当办公AI走出屏幕:WorkBuddy要打一场“硬仗”
撰文 | 李信马
题图 | DoNews摄
9月2日,DoNews参加在深圳举办的腾讯WorkBuddy生态发布会时,仿佛误入了一场智能硬件的展览会,从耳机到眼镜,再到摄像头和笔记本,这些应用于物理世界的产品,在此处与办公AI进行了深度的融合。
图源:DoNews摄
当天WorkBuddy正式上线了开放平台,并首次披露了完整的开放生态战略。据了解,开放平台同时打通了硬件、应用与开发者三层生态的开放平台,引入超百家生态伙伴,并面向智能硬件、行业应用与开发者等开放底层Agent能力。
“Agent‘能做事’这道坎已经跨过去了。真正的挑战是,让它在任何设备、任何系统、任何场景里都不中断。要让用户真正拥有触手可及、不间断的Agent服务能力,就需要打通生态上下文,构建服务闭环。对开发者与各领域企业而言,行业的Know-How、场景数据、流程等都已经成熟,但Agent化门槛高、成本重的挑战仍在。”腾讯WorkBuddy开放生态负责人林佐露表示,“所以我们选择开放——把能力拆成硬件、行业应用、开发者三条路径,让每一个行业、每一位伙伴,都能把Buddy接进自己的场景。”
尤其引人注目的,是发布会上硬件厂商的集体亮相,包括Plaud、乐奇Rokid、影石、科大讯飞、安克、猛玛、京东京造等品牌。这是以往在Agent赛道没有出现的景象,也是我们即将看到的未来:办公AI正走出屏幕,进一步深入现实世界。
01、Agent的困境:不是不够聪明,是够不到现场
要理解硬件对于办公AI的意义,得先看清Agent当下真正的瓶颈所在。
过去几年,办公软件的进化逻辑是在原有工具上加一个AI按钮,比如文档里嵌一个写作助手,会议软件里加一个自动纪要,这种模式简单易操作,也能提效,但AI像是在现有工作流上打一个补丁,用户需要主动在页面上点击运行。
而一个真正的办公Agent,或者说我们期待的AI员工,能做到理解任务、拆解步骤、调用工具、交付结果,甚至主动跟进,它得感知到任务发生的现场——听见会议室里的讨论,看见眼前的文档和场景,接住用户随口抛出的一句指令。换句话说,Agent在软件界面里,感官只有键盘和鼠标;一旦进入现实世界,它就需要麦克风、摄像头、可穿戴设备来充当耳目。
腾讯云副总裁、CodeBuddy&WorkBuddy负责人刘毅在现场给出了一个直白的表述:“真正的生产力,从来不取决于一个工具有多强,而取决于它能连接多少能力、走进多少场景。”AI的能力再强,如果无法贴近用户的工作现场,就始终隔着一层“人把需求翻译给机器”的损耗。
在其他办公AI还将竞争的焦点放在卷模型、卷软件时,WorkBuddy将注意力转向用户发起任务的入口,而硬件,正是这场入口争夺战在物理世界的第一批据点。一个自然的问题是:既然硬件如此关键,为何之前行业里成体系的尝试并不算多?
DoNews认为,首先,能做这件事情的厂商需要强大的产品能力和AI能力,只有少数大厂才有底蕴,但让一家麦克风或眼镜厂商去做,既不现实也不经济。其次,是生态的碎片化,如果没有统一标准,就算接入硬件,账号、任务、记忆可能也无法跨端延续,不同品类、不同品牌的硬件可能也会产生冲突。最后,办公是严肃场景,对AI幻觉的容忍度极低,而硬件可以采集大量隐私信息,其安全边界与数据去向,也是用户心头的问题。
对于这些问题,WorkBuddy给出了自己的答案:围绕“听、看、记、聊、协”五类触点,厂商一次接入即可打通硬件、App、PC、Web多端,让账号、任务、记忆与产物在设备之间无缝流转——硬件厂商专注设备本身,行业伙伴注入场景与数据,Agent底座负责理解与执行。
正如WorkBuddy在PPT中所展示的,AI的第三个阶段,正是从屏幕走进硬件。
02、让Agent能够“听、看、记、聊、协”
我们来具体拆解下WorkBuddy的方法论,首先,是五类触点,在WorkBuddy的资料中没有具体的介绍,DoNews认为应该是:
-
听——语音采集。代表性的硬件有录音卡片、麦克风、耳机等。
-
看——视觉感知。代表性的硬件有智能眼镜、相机等。
-
记——输入与控制。代表性的硬件有键鼠、键盘麦等。
-
聊——交互与陪伴。代表性的硬件有桌面陪伴设备、智能音箱等。
-
协——可能是方便随身协同的产品,比如平板或手机。
很明显,这个分类是按交互形式来划分的,同一类触点可以收集同类或者相似的数据。这样硬件负责采集数据与结果展示,复杂的理解与执行交给云端Agent,任务完成后再将结果回传设备。由此实现“同一个Buddy,不同硬件”,用户无论对着耳机说话、用眼镜拍照,还是在PC上打字,使用的都是同一个账号,任务、记忆与产物在设备间无缝流转,上下文不中断。
本质上,是给Agent搭起了一套“五官与四肢”。
当天展台处与“听”相关的产品占比较大,林佐露在采访中表示:“WorkBuddy作为一个智能体,受益于大语言模型的快速发展,能更好地理解人的一句话所表达的意图,然后去规划任务和调用工具,最后去执行。这样的基于语言的交互方式会让我们跟语音类的硬件的串联更友好。”
而优秀的硬件产品也会与智能体相得益彰,比如影石科技的负责人表示,他们的产品在办公室内有半径3到5米的拾音且带降噪,可以把有效信息输入给WorkBuddy。“一个智能体再优秀再强,你输出的信息一定要准确,输出的指令才应该是正确的。”该负责人说。
科大讯飞穿戴业务事业部总经理林会杰在采访中也表示,随身穿戴的设备比如耳机或者眼镜,实际是随身的AI入口,可以将用户在物理世界接收到的信息持续地通过端侧的模型进行“token化”,之后这些数据再通过WorkBuddy处理长程的复杂任务。“比如我开了一整天的会议,讲了很多内容,就可以通过耳机和眼镜记录,再让WorkBuddy帮我总结这一天我都做了哪些事情,哪些是比较重要的,让我的耳机和眼镜真正成为我的‘第二大脑’和AI的记忆外挂。”
从已接入的规模看,这套框架覆盖了十余个品类、超过30个品牌,首批9款联名硬件也在当天首发,其中多款是在各品类中首次接入Agent能力,这意味着WorkBuddy对部分硬件的接入已经推动了其产品形态的创新。“很多硬件终端希望可以成为WorkBuddy外设的输入,或者能在WorkBuddy上有一个cloud Agent,可以让终端的能力能够调用、能够管理、能够操作,这是这类伙伴我们看到的需求,这个需求被满足好的话,确实会让一些用户用得‘特别爽’。”林佐露说。
03、入口即未来:办公AI的下一站
把视角拉回产业全景,办公AI的演进脉络正变得清晰。
第一阶段是功能嵌入,在现有办公软件里加AI能力,比如各类写作、纪要助手;第二阶段是Agent化,AI从被动工具变成能自主拆解、执行任务的智能体,比如各类办公Agent平台;而第三阶段就是走进硬件,Agent通过硬件进入物理世界,成为真正“随身”的生产力。
对WorkBuddy来说,这也是一种“大势所趋”。正如林佐露所说:“我们看到很多硬件让用户的使用可以更随身,可以更便捷,WorkBuddy这样的产品被更高频地使用,其实是对我们的促进。我们相信硬件未来会是一个很重要的Agent的外设,所以我们在拥抱这样的趋势。”
当麦克风、眼镜、耳机都能成为Agent的入口,我们离“无处不在的办公伙伴”还有多远?答案,正写在这场硬仗的进程里。
免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。


