返回专题列表
AI 智能体:从聊天到行动
自主 AI 智能体从一个开源实验演变为消费级产品品类的全过程
2023 年 3 月,一个独立开发者发布了一个名为 Auto-GPT 的开源实验 — 一个可以自主设定目标并追求目标的 AI。它有 bug、成本高昂、而且经常没用。三年后,数百万人使用 AI 智能体 — Claude Code、OpenAI Operator、OpenClaw — 来编写生产代码、浏览网页和管理日常任务。本专题追溯了从原型到基础设施再到产品的旅程:一个拼凑出来的演示如何揭示了一种渴望,整个行业争先恐后地去满足它,以及 AI 如何从对话式跨越到自主式。
2023 年 3 月,开发者 Toran Bruce Richards 发布了 Auto-GPT,一个基于 GPT-4 API 的开源实验。与响应提示的聊天机器人不同,Auto-GPT 颠覆了范式:给它一个目标('研究顶尖 AI 公司并写一份报告'),它就会自主串联 LLM 调用、网络搜索、文件操作和代码执行,直到目标达成。它在 GitHub 上病毒式传播 — 首个广泛可用的'AI 智能体'演示。该项目有严重的限制:频繁陷入循环、自信地产生幻觉、API 成本飞涨。ChaosGPT 实验 — 有人让它去'毁灭人类' — 带来了主流媒体关注。但其影响与其技术成熟度不成比例。Auto-GPT 向一代只知道'聊天机器人'的开发者介绍了'智能体'概念。它展示了潜在需求 — 开发者不仅希望 AI 说话,更希望 AI 做事。原型是粗糙的,但方向已经不可逆转。
核心洞察
第一个智能体是个拼凑品 — 而这正是它重要的原因。它在基础设施存在之前就证明了需求。每个产品类别都始于粗糙的原型,智能体也不例外。
Auto-GPT 证明了智能体是被需要的,但它也证明了点式解决方案无法规模化。每个工具集成都需要自定义代码;每个 AI 模型需要自己的适配器;没有智能体与世界交互的标准方式。2024 年底的两项进展解决了这个问题。11 月,Anthropic 开源了模型上下文协议(MCP)— 一个用于连接 AI 系统与外部工具、数据源和服务的标准化协议。任何兼容 MCP 的智能体现在都能连接到任何 MCP 服务器:Google Drive、Slack、GitHub、数据库。12 月,Google 推出了 Gemini 2.0 和 Project Mariner,一个研究原型,展示了一个可以浏览网页并在浏览器内完成任务 AI 智能体。Project Mariner 展示了智能体在拥有正确工具时能做什么 — 浏览网站、填写表单、管理多步工作流。MCP 和 Mariner 共同解决了实用智能体的两个前提条件:连接工具的标准方式,以及这种连接能实现什么的示范。管道正在铺设。智能体时代不再是'是否'的问题,而是'多快'的问题。
核心洞察
智能体革命既需要模型,也需要协议 — MCP 是那个让一切成为可能的幕后基础设施。教训是:没有集成标准的原始能力,到不了用户手中。
2025 年 1 月和 2 月迎来了第一批生产级智能体。OpenAI 于 1 月 23 日发布 Operator — 一个可以自主浏览网页、填写表单、预订票务、完成多步在线任务的 AI 智能体。与 Auto-GPT 脆弱的 API 调用链不同,Operator 以视觉方式与网页交互,使用经过训练的模型像人类用户一样'看'和'点击'。它有限制(慢、昂贵、有时出错),但它确实能用 — 第一个非技术用户可以交给真实任务的智能体。一个月后,Anthropic 发布了 Claude Code — 一个基于终端的编程智能体,可以理解整个代码仓库、编写补丁、执行多步开发任务。与早期在 IDE 内辅助的 AI 编程工具(Copilot、Cursor)不同,Claude Code 作为自主智能体运作:收到一个 bug 报告,它会找到问题、编写修复、测试它、并提交拉取请求。到 2025 年年中,Claude Code 成为第一个真实开发团队信任处理生产代码的智能体。Operator 和 Claude Code 揭示了智能体市场有两个入口:网页(面向所有人)和终端(面向开发者)。两者都从'有趣的演示'跨越到了'有用的工具'。
核心洞察
第一批生产级智能体通过两扇门进入:面向所有人的网页浏览,和面向开发者的编程。这不是一个市场 — 这是两个,用户不同、经济模式不同、普及曲线也不同。
随着智能体在终端中证明了自己,它们的影响开始改变人们对编程本身的看法。2025 年 2 月,OpenAI 联合创始人 Andrej Karpathy 创造了'氛围编程'(vibe coding)这个词 — 让 AI 写代码,而人类仅描述他们想要什么,有时甚至不阅读输出。这个词病毒式传播,因为它命名了一个真实存在的东西:智能体不仅仅在辅助程序员;它们在重新定义编程的意义。到 2026 年 1 月,智能体已经触及消费者。OpenClaw,一个可以管理日程、浏览、购物和通讯的个人 AI 智能体,病毒式传播 — 创造了第一个主流个人 AI 智能体现象。与 Claude Code(面向开发者)和 Operator(面向网页任务)不同,OpenClaw 是一个通用个人助手,数百万非技术用户将其融入日常生活。OpenClaw 的爆火证明了智能体不仅是一个开发者工具或商业产品 — 它们正在成为消费者品类。从 Auto-GPT 的粗糙原型到 OpenClaw 的主流普及,这条旅程用了不到三年。在这段时间里,智能体从概念演示演变为基础设施层,再到一组生产工具,最后到消费者现象。从'聊天'到'行动'的转变已经完成。
核心洞察
智能体在不到三年内从开发者工具跨越到了消费者产品 — 比智能手机本身还快。这个速度说明了一个事实:人们在智能体准备好之前就已经准备好了。
结语
智能体转型的速度令人叹为观止。2023 年 3 月,'AI 智能体'的概念还是一个充满 bug 的开源实验。到 2026 年 1 月,数百万人每天都在工作和个人任务中使用智能体。基础设施 — MCP、视觉浏览模型、终端智能体 — 是在实时建造的,以回应 Auto-GPT 所揭示的需求。
从聊天到行动的转变,也许是自 ChatGPT 以来 AI 领域最重要的产品转型。它改变了人与 AI 之间的基本关系:从询问到委托。这不只是便利性的提升 — 它改变了谁可以使用 AI 以及用来做什么。聊天机器人需要表达能力;智能体需要信任。一个障碍是认知层面的,另一个是情感层面的。智能体行业真正的挑战不是构建更强大的模型,而是赢得委托所需的信任。
剩下的问题不是智能体是否会无处不在 — 这个轨迹已经确定。问题是当智能体开始委托其他智能体时会发生什么,而人类变成了他们曾经控制的循环中的旁观者。