AI 智能体下半场:缰绳比模型更重要
2026 年 8 月, AI 行业连续出现几个看似零散、实则指向同一件事的动作: Anthropic 把只在命令行里跑的 Claude Code 改造成了不会写代码的普通人也能上手的 Cowork ;英伟达发表研究,说决定智能体表现的往往不是模型本身,而是套在模型外的那根缰绳 ; OpenAI 则因为在研的 Astra 能够独立识别并攻击现实世界防护良好的系统,主动踩下了刹车。把这几件事放在一起看,一个信号已经浮出水面: AI 智能体的竞争,正在从谁的模型更大,转向谁的编排层更稳、谁的产品形态更好。
时间线:竞争焦点的一次迁移
过去两年,智能体的叙事是模型越大越好。从 ChatGPT 把对话式 AI 做成人人可用,到 Claude Code 把智能体带进命令行,赛道上的第一优先级始终是模型能力。但 2026 年 8 月的节点,重心换了方向。开源智能体 Hermes Agent 在一个月内连发两个版本: v0.20.0 代号 The Herald ,合并约 1400 个 PR ,带来流式语音、智能体间协议与桌面平台化;紧接着的 v0.20.5 补丁版又合入 323 个 PR 、约 746 个提交,覆盖约 1250 个文件。版本规模本身不值一提,方向上却很说明问题:它的新增几乎全是让人更容易用起来的能力,比如免密钥网页搜索,轮换 5 家供应商的免费额度并做环形故障转移; cron 任务的持久化记忆与可控推理成本;桌面端的多线程与拖拽附件;以及把桌面端从聊天客户端升级成支持插件 SDK 与实时预览的工作台。这些不是模型变强,而是产品变完整。
英伟达的缰绳理论
英伟达的研究给出了一个反直觉的结论: AI 智能体可以通过微调,在特定任务上表现出色且不失控,哪怕底层的 AI 模型本身并非特别擅长该任务。这暗示智能体的 harness ,也就是约束与编排框架,正在取代模型本身,成为决定表现的关键。模型是发动机,但决定车能不能平安抵达的是方向盘、刹车和导航。当各家模型能力逐渐趋同,差异就落在缰绳上:能不能让智能体稳定地跑完整个任务、中途不跑偏、该停就停。
人人可用:把智能体做成软件产品
Anthropic 的动作是这条叙事最直观的注脚。 Cowork 把原本面向程序员的 Claude Code ,扩展到完全不编程的普通用户,直接在工作文件里协作,无需写一行代码。据称团队大约只用一周半时间、主要靠 Claude Code 自身构建出这个功能,堪称用 AI 造 AI 的样本。与此同时, Anthropic 还把它的自动模式设为默认开启,意味着用 AI 编程需要更少的人工监督,自主完成的边界进一步扩大。这两步连起来看,方向非常明确:把留给工程师的工具,变成给所有人的产品。
桌面与浏览器:产品形态的正面争夺
形态之争也在同步上演。 OpenAI 在 2026 年 8 月为 Linux 推出原生桌面客户端,补齐桌面端拼图,此前已覆盖另两套主流系统。 Cloudflare 发布了一个为智能体设计、而非为人类设计的云托管浏览器,执行常见自动化任务时更省算力。另一家做自动化的初创公司 Relay 宣布关闭,团队并入谷歌浏览器,创始人表示未来要在里面探索辅助工作流。连浏览器都在为智能体单独开一条赛道——智能体已经不只是聊天框里的一项功能,而是正成为一种被独立承载、独立分发的应用形态。
三种竞争者的分野
把这三个阵营放在一起对比,分野会更清楚。模型厂商想守住模型这层护城河,于是把智能体外包、把产品形态做轻;编排与框架的研究者,则在证明决定输赢的往往是可控性而非模型本身;而把智能体做成消费级产品的一方,正在快速抢占普通用户与企业的工作入口。三者并不互斥,但谁先把手伸向缰绳与产品形态,谁就先一步拿到智能体下半场的门票。这个判断,正是 2026 年 8 月最值得被记录的拐点。
安全:一根看不见的缰绳
竞争的另一面是约束。 OpenAI 表示在研的 Astra 模型已达到关键网络安全阈值,能够独立识别并攻击现实世界里防护良好的系统,因此主动放缓了开发进程。这才是最值得警惕的一根缰绳:当智能体不仅能干活、还能作恶,它的上限就不再由能力决定,而由安全边界决定。这也解释了为什么可控性正在被行业当成竞争力本身。
与资本、市场的交叉验证
把视角拉宽一点,市场也在为智能体从拼模型转向拼产品这件事定价。有数据显示,企业用户会随各家实验室发布新模型而在 OpenAI 与 Anthropic 之间频繁切换,OpenAI 的企业份额正追近 Anthropic ,企业支出的粘性并没有想象中高。资本面同样拥挤: AI 编程创企 Cognition 据报正洽谈新一轮融资、估值或达 400 亿美元,而几个月前它刚以约 260 亿美元估值完成 10 亿美元融资; AI 图像与视频公司 Higgsfield 完成 4 亿美元 B 轮,8 个月估值翻四倍至 54 亿美元。资本追逐的焦点,已经从纯模型厂商蔓延到工具、应用与编排层。
为什么值得关注
智能体从上到下,正在经历一次范式级的迁移。过去两年,行业把几乎全部资源押在模型推理能力上,拼参数量、拼 benchmark 分数,仿佛模型就是智能体的全部。但 2026 年 8 月这组信号告诉我们,天平正在倾斜:当模型能力逐渐趋同,真正区分产品与玩具的,是能不能把这份能力装进稳定、可控、好用且安全的容器里。对普通用户而言,这意味着智能体终于不再需要程序员来驱动;对企业而言,这意味着 AI 支出不再是绑定单一实验室的赌注;对开发者而言,这意味着新的机会出现在编排层与产品层,而不是停留在模型层。
下半场怎么打
把这些线索串起来,结论已经清晰:智能体竞争的下半场,比的不是谁的参数更多,而是谁的缰绳更可靠、谁的产品有人愿意打开、谁的自动化能在真实工作流里守得住。对内容创作者与开发者而言,这意味着一件事——与其反复纠结哪个模型最强,不如把注意力放到怎么把智能体编排得稳定、可控、好用上。模型会快速迭代,但一套能承载真实业务的编排与产品形态,才是真正能沉淀下来的资产。 所以问题来了:如果你的智能体很聪明,却总在关键时刻自作主张,你该换一个更大的模型,还是先检查一下那根缰绳? 这个问题,建议你在下一次把智能体真正接进工作流时想一想:先别急着换更大的模型,试着把它的任务边界、审核机制与失败兜底写清楚,看看稳态是否干净利落。也许你会发现,智能体下半场的胜负手,并不在那一排参数里,而在这根被你握住的缰绳上。