WorkBuddy 把底座掀开了:Agent 的未来,不是更聪明,而是无处不在
原文作者:Mocha · 原文来源:今日头条
本文为作者本人文章的站内同步版本。
过去半年,AI Agent 最明显的变化是什么?
不是模型又涨了多少分,也不是谁又做出了一个更长的上下文。
而是 Agent 终于开始真的“干活”了。
整理文件、做 PPT、分析数据、查资料、写报告、调用软件……这些事情已经不再新鲜。
但另一个问题开始越来越明显:
Agent 会干活了,却依然被困在一个个软件和设备里。
你在电脑上和 AI 聊过的项目,换到手机可能又要重新解释;会议录音在录音设备里,资料在企业系统里,聊天记录散落在不同软件里,真正执行任务时又得回到 PC。
AI 很聪明,但上下文是断的。
这可能才是腾讯 WorkBuddy 在 9 月 2 日发布开放平台背后,真正想解决的问题。

WorkBuddy 不想只做一个更强的 AI 工具了
9 月 2 日,腾讯 WorkBuddy 开放平台正式上线。
这次腾讯没有再把重点放在“我们又增加了什么 AI 功能”上,而是直接把 WorkBuddy 的 Agent 底座拆开,开放给智能硬件厂商、行业应用公司和开发者。
首批已经有 100+ 家生态伙伴加入。
现场一次亮相了多款 WorkBuddy 联名智能硬件,合作厂商覆盖智能眼镜、录音设备、耳机、键鼠、桌面硬件等多个品类;另一边,金融、法律、医疗、教育、企业服务等行业应用也已经开始接入。
如果只看产品数量,这很容易被理解成一次普通的“生态发布会”。
但真正值得关注的其实是:
腾讯开始把 WorkBuddy 从一个 AI 产品,往一个 Agent 平台推。

这次开放平台首期直接拆出了五类能力:
硬件、Buddy 应用、专家、Skill、连接器。
以前这些东西散落在完全不同的产品和开发链路里,现在腾讯试图把它们全部接到同一个 Agent 底座上。

腾讯云副总裁、腾讯 CodeBuddy & WorkBuddy 负责人刘毅在发布会上给 WorkBuddy 提出了一个很有意思的方向:
面向 Agent 时代的操作系统。
这里的“操作系统”,当然不是说 WorkBuddy 要去替代 Windows 或 macOS。
它更像是在争夺另一层东西:
Agent 的运行底座。
设备负责采集信息。
行业公司提供专业知识和业务系统。
开发者提供 Skill 和工具。
WorkBuddy 则负责理解任务、调度能力、保持上下文,并最终把事情完成。
如果这个逻辑真的跑通,AI Agent 的形态会发生很大变化。
以后我们可能不会再问:
“这个设备有没有 AI?”
而是:
“这个设备能不能接入我的 Agent?”
智能硬件,终于不用每家都重新造一个 AI
这是我觉得这次发布里非常值得关注的一部分。
过去两年,智能硬件行业有一个挺尴尬的现象。
做眼镜的,要做自己的 AI。
做耳机的,要做自己的 AI。
做录音设备的,也要做自己的 AI。
甚至键盘、桌面设备、手表,都恨不得塞进去一套独立 AI。
问题是,大多数硬件厂商真正擅长的是传感器、工业设计、影像、声音或者某个具体场景,而不是从零开始做模型、Agent、记忆系统、工具调用和多端同步。
结果就是大家都在重复造轮子。
WorkBuddy 这次选择把底层 Agent 能力直接开放出去。
围绕 “听、看、记、聊、协” 五类触点,目前已经接入智能眼镜、录音卡片、麦克风、耳机、桌面陪伴设备、键鼠、PC 与平板、智能穿戴、手机等多个品类。

但这件事真正有价值的地方,并不是“WorkBuddy 又能控制几个设备”。
而是:
这些设备开始尝试共享同一个 Agent。
这也是发布会上我认为最值得记住的一句话:
同一个 Buddy,穿梭每一种硬件。
下面跟着三个关键词:
一个账号。一个资料库。一个会干活的 Buddy。

这和现在很多所谓的“AI 硬件”思路其实完全不同。
今天你买一个 AI 录音设备,里面有一个 AI。
买一副 AI 眼镜,又有一个 AI。
手机里还有一个 AI。
电脑上再装三个 Agent。
最后用户面对的是五六个互相不认识的“智能助手”。
每一个都很聪明。
但每一个都要重新认识你。
如果 WorkBuddy 想做的事情成立,逻辑就会反过来:
AI 不是设备里的一个功能。
设备只是同一个 Agent 的不同触角。
你戴着智能眼镜参加会议。
眼镜负责看和听。
WorkBuddy 在后台继续理解会议内容、调用资料、整理纪要、提取待办。
回到电脑以后,不需要重新开始一个对话,它可以继续写邮件、整理方案,甚至调用其他软件完成后面的工作。
Rokid × WorkBuddy 的联名 AI 眼镜,就是这套逻辑目前比较直观的一个案例。

眼镜负责感知世界。
真正复杂的任务,则继续交给 WorkBuddy。
这时候,硬件就不再需要自己成为一个“完整 AI”。
它只需要把自己最擅长的能力提供出来。
摄像头负责看,麦克风负责听,录音卡片负责记,键鼠负责操控,手机负责移动,电脑负责生产。
而同一个 Agent 在这些设备之间继续工作。
硬件千姿百态,大脑始终如一。
这可能才是 AI 硬件真正值得期待的形态。
更值得关注的,其实是 Buddy 应用
如果说硬件解决的是 Agent:
“从哪里进入现实世界?”
那么这次一起开放的 Buddy 应用,解决的是另外一个问题:
AI 怎么真正进入一个行业?
很多公司做垂直 Agent 时,很容易陷入一个坑。
重新做模型,重新做聊天框,重新做工作台,重新做记忆,重新做权限,重新做工具调用。
团队花了大量时间重复造 AI 基础设施,真正属于自己的行业经验,反而只占很小一部分。
Buddy 应用的思路恰恰反过来。
WorkBuddy 提供底层 Agent 能力。
合作伙伴需要做的,则是把自己的:
行业经验、业务场景、数据、工具、Skill、专家和系统接进来。
以前一家金融、法律或者 SaaS 公司想做 AI,首先考虑的是:
“我要怎么造一个 Agent?”
如果平台模式成立,以后问题可能会变成:
“我们真正懂这个行业的东西是什么?”
这两句话看起来差别不大。
但对于大量传统软件公司来说,区别非常大。
因为真正难以复制的,从来不是再做一个聊天框。
而是几十年沉淀下来的:
业务流程、行业知识、客户数据、专业判断和工具体系。
这些东西才应该成为企业做 AI 时投入最多的地方。
Skill、Expert、Connector,也终于被放进了同一个生态里
对于开发者来说,这次开放出来的另外三块会更熟悉:
Skill、Expert、Connector。
Skill 可以理解为:
Agent 做某件事的方法。
比如怎么写一篇公众号文章、怎么分析一份财报、怎么整理会议纪要、怎么操作某个企业系统。
它把过去藏在 Prompt、流程甚至人的经验里的东西,变成 Agent 可以反复调用的能力。
Expert 则往前走了一步。
你不只是告诉 Agent:
“这件事情应该怎么做。”
还可以告诉它:
“遇到这一类问题,应该用什么专业视角判断。”
再进一步,多个 Expert 还可以组成专家团队。
而 Connector 解决的是另一个一直绕不开的问题:
AI 怎么真正碰到外面的世界?
数据库在哪里?
企业系统在哪里?
第三方 SaaS 在哪里?
文件在哪里?
现有命令行工具在哪里?
现在 WorkBuddy 的 Connector 提供了包括 MCP、CLI 在内的接入方式。
这意味着以前散落在不同地方的东西——
Prompt、Skill、MCP、CLI、行业知识、业务系统、Agent……
开始被放进同一个运行环境。
这件事情的重要性,可能要再过一段时间才会真正显现出来。
因为 Agent 接下来真正缺的,已经不是:
“再多一个聊天框。”
而是:
“更多真正能调用、能执行、能完成任务的能力。”
Agent 的竞争,可能正在从“模型能力”转向“生态能力”
过去我们评价一个 AI 产品,习惯比较:
谁模型更强?
谁回答更准确?
谁上下文更长?
谁写代码更厉害?
这些当然依然重要。
但当 Agent 已经开始执行真实工作以后,竞争维度正在增加。
一个 Agent 再聪明,如果它什么都连接不了,也很难完成复杂任务。
反过来,一个 Agent 如果能够理解你的历史上下文,又能调用几十种工具,连接企业内部系统,还可以随着你从电脑移动到手机、眼镜、耳机和各种设备,它产生的价值就完全不一样。
所以 WorkBuddy 这次真正想连接的,其实是三类东西:
硬件、行业、开发者。
硬件提供触点。
行业公司提供 Know-how。
开发者提供 Skill 和 Connector。
Expert 提供专业能力。
而 WorkBuddy Agent 底座负责把这些东西串起来。
这里我反而很喜欢发布会上出现的另外三个词:
在场。
互联。
开放生态。
这三个词基本把 WorkBuddy 接下来想做的事情概括完了。
不是让 AI 永远躲在电脑里的聊天窗口。
而是让 Agent 真正进入用户所在的地方。
WorkBuddy 真正想争的,可能不是办公软件入口
WorkBuddy 一开始很容易被归进“AI 办公 Agent”这个类别。
写 PPT。
做表格。
分析资料。
生成文档。
调用电脑软件。
如果只是沿着这条路走,它最终竞争的还是:
“谁是最好用的 AI 办公软件。”
但按照这次开放平台展现出来的路线,它想做的事情明显更大了一层。
它正在从:
“我帮用户完成任务。”
走向:
“其他产品也可以基于我,让自己的用户完成任务。”
两句话看起来只差一点。
商业逻辑却完全不同。
前者是在做产品。
后者是在做平台。
甚至这次发布会上还出现了一个很有意思、甚至有点极端的案例:
机器人。
启元机器人直接把 WorkBuddy 接进了机器人系统。
机器人负责运动和物理执行,WorkBuddy 则承担理解需求、调用工具和编排任务的角色。

从电脑,到眼镜,到耳机,再到机器人。
你会发现 WorkBuddy 这次展示的产品看起来越来越“不像 WorkBuddy”。
因为它开始不在乎自己长什么样。
它更在乎:
Agent 能不能出现在需要它的地方。
这也让我觉得,“Agent 操作系统”这个说法虽然现在听起来有点大,但至少背后的产品逻辑已经可以看到了。
真正的操作系统从来都不是什么都自己做。
它真正重要的能力,是让:
硬件可以接进来。
软件可以跑起来。
开发者可以创造东西。
用户可以在不同场景里继续完成同一件事情。
这恰好也是 WorkBuddy 这次开放平台正在尝试做的事情。
当然,现在就说 WorkBuddy 已经成为“Agent 时代的操作系统”,显然还太早。
开放能力是一回事。
开发者愿不愿意长期进来做东西,是另一回事。
生态资产有没有足够多的真实用户使用,也是一回事。
支付、分发和商业闭环能不能真正跑起来,更需要时间验证。
但至少这次之后,WorkBuddy 想往哪里走,已经比之前清楚很多了。
Agent 的第一阶段,是让 AI 会聊天。
第二阶段,是让 AI 会干活。
而第三阶段,也许就是:
让同一个 Agent,无论你走到哪个设备、打开哪个系统、进入哪个行业,都能继续把事情做下去。
如果真走到这一步,
我们最终需要的可能不是十几个互相不认识的 AI 助手。
而是一个真正认识你、记得你的工作,并且可以在不同地方继续替你干活的 Agent。
腾讯现在正在下注这个方向。
