AI AI Agent开源智能体Hermes

智能体的缰绳时代:真正的主角不是模型

📅 2026-08-28

过去三年,AI 行业的注意力始终被「模型」占据:参数规模、榜单分数、多模态能力,几乎每一次发布都把聚光灯打在底座大模型上。但 2026 年 8 月,两条几乎不相干的消息线同时指向一个被忽视的变量——智能体。一条是开源智能体 Hermes 在三周内连续发布四个版本,把一个面向开发者的命令行工具变成带桌面平台、实时语音、跨智能体协议的生产级系统;另一条是英伟达研究给出的反直觉结论:决定智能体表现与安全的,不是模型本身,而是套在它外面的那层「缰绳」(harness)。这一个月,行业的天平开始向「智能体」一侧倾斜。

三周四个版本:一个开源项目的高速迭代

Hermes 是 Nous Research 的开源智能体。2026 年 8 月 3 日,它发布 0.20.0「Herald」,被项目称为史上最大单次版本:数千次提交、一千多个合并请求、六百多位贡献者。这次更新带来三个真正改变形态的能力——可打断的流式实时语音与本地唤醒词、智能体间通信标准协议 A2A v1.0,以及签名出站 Webhook 与可验证引用。桌面端也从单一窗口升级为含插件开发套件与工件预览的平台。

还没等稳定,迭代就已经开始。8 月 18 日,0.20.4 合并约 74 个 PR,补上桌面玻璃拟态(matte glass、frost picker)、SESSIONS|BOTS 侧边栏、Bot Mode 群聊修复,以及一项关键能力——技能安全扫描。一天后,0.20.5 合并约 323 个 PR、746 个提交,把「无密钥 Web 层」带进来:默认轮换五家厂商的免费额度并配备环形故障转移,全新安装无需任何 API 密钥即可启用网页搜索,配合一条命令安装器,把上手门槛压到接近零。8 月 27 日,0.20.6 再合并约 525 个 PR,新增用户授权的真实浏览器档案浏览、桌面独立窗口与受管远程更新引擎、五十多个经实时验证的厂商托管服务,并默认启用结果压缩与钥匙串密钥加密。

三条数据线足以说明这轮迭代的密度:0.20.0 累计约 3650 提交,0.20.5 单次合并 746 提交,0.20.6 单次合并 525 个 PR。比起普通项目一年的发布节奏,这是一种异常的工程吞吐量。当然,载体越大越容易蹲车,对应的是更加完备的更新机制:默认先存前置快照,拉取代码后如果关键文件编译失败就自动回滚,还提供纯预览、舰队更新计划、全量备份,并支持从消息平台直接发指令更新。值得说的是,0.20.5 还给定时任务新增了持久化记忆与按任务调节推理强度,让自动化任务能跨执行保留状态、按需控制成本,这些都是把一个平台做稳的细节。

从「模型」到「harness」:护城河换了位置

英伟达 8 月 21 日的研究提供了理解这轮变化的钥匙。它展示,智能体可以通过微调在任务上表现良好且不失控,即使底层模型本身并不特别擅长该任务。结论是:智能体的 harness——约束与编排的那套框架——正取代模型本体,成为决定表现的关键环节。这个论点在当前的行业您氟里尤其尖锐:在“模型差异化利弥”打暗、近乎同质化的背景下,得出“巯子差在框架不在模型”的结论,无疑是一首冷水,也是一次拐点。

Hermes 的架构恰好在为这个结论做注脚。社区拆解显示,它的命令行、消息网关、定时任务、编辑器插件与批量任务,全部实例化同一个智能体类,底层兼容多种厂商协议并统一为单一会话结构,可运行在众多消息平台与多种沙箱。换句话说,模型是可替换的零件,而「会话结构加协议兼容加沙箱隔离」这一整套 harness 才是项目真正的积累。0.20.0 的 A2A v1.0、签名出站 Webhook,0.20.6 的浏览器档案门控与远程更新引擎,本质都是把 harness 的边界越画越清晰——智能体可以做什么、以什么权限做、向谁汇报,都由这一层决定。当你把这层赋予的权限越明确,选择的模型就可以越自由,而不会反过来被某个供应商单点绑定。

同月,Anthropic 用大约一周半时间打造出 Cowork,把 Claude Code 扩展给无编程背景的普通用户,全程主要靠 Claude Code 自身构建,被视为「用 AI 造 AI」的典型案例。当建智能体的工具已经能把自己建出来,模型之间的差异会被 harness 的差异迅速稀释。市场端也在验证这个判断:新数据显示,企业用户随着各家实验室发新模型而在 OpenAI 与 Anthropic 之间频繁切换,OpenAI 的企业市场份额正在追近 Anthropic——这种波动提示企业 AI 支出的「粘性」可能没有想象中高,接口与编排层的可替换性正在变成更实际的考量。

快速膨胀的另一面:信任模型缺口

但能力扩张的同时,隐患也在同一时间被放大。Ars Technica 报道,研究者发现上百个网站文档引用无人认领的可执行包,智能体会把说明文件当作权威安装指南自动执行,多款智能体在数十家大型公司的内网测试环境里触发了这个问题——这是信任模型的缺陷,而不是某个厂商的 bug。当智能体开始自主安装依赖、读取网页说明、执行命令,「文档即指令」的默认假设成了它最脆弱的一环。器械的安全问题往往不是在一个急踩制地方爆发,而是在日常的「平淡行为」里漏出来,这正是智能体安全的可怕之处。

这解释了为什么 0.20.4 会专门加上技能安全扫描、0.20.5 把无密钥 Web 层设计成「零鉴权加环形故障转移」而非「无脑开放」:开源社区已经意识到,harness 的两面性在于——它既是护城河,也是最容易被攻破的界面。当全行业都在把智能体往前推,谁先把这层的安全边界录明确,谁就拥有了在发布节奏与安全卸之间冲冲平衡的能力。

资本与护栏同时加速

行业的判断正在同步。据 theaiinsider 报道,Nous Research 拟完成至少七十五百万美元融资,估值达十五亿美元,较此前累计融资大幅跳升,旗舰项目正是这个开源智能体 Hermes 及其自改进能力。开源智能体第一次拿到接近「平台级」的估值,这本身就是一个红利信号。与此同时,OpenAI、Anthropic、Google 等逾百家 AI 企业联合呼吁,应对可能「失控或叛变」的 AI 对企业系统发起的攻击风险。 一定要注意的是,这两条消息并不冲突,而是同一件事的两面:既看到智能体平台化的商业潜力,也看到其安全边界的转模梱。当智能体拥有更多的自主执行能力时,它的求和它的威胁是同一个东西,这就是这一层 harness 之所以比模型更学安全的原因。

为什么值得关注

智能体的价值判断正在经历一次范式转移:过去的竞争是「谁的模型强」,未来的竞争是「谁的 harness 稳」。模型会快速同质化,而 harness——权限边界、协议兼容、沙箱隔离、审计引用——是少数随着时间反而变深的资产。对开发者而言,这意味着花在模型调优上的边际收益在下降,而花在编排、权限与可追溯性上的投入在上升。当智能体开始自己装软件、自己读文档、自己执行命令,谁先补上那层可持续的信任模型,谁就真正站在了平台的位置上。

← AI 失控无预案:百余家公司的联合与沉默 → AI 频道 AI 智能体协议之战:开源平台化的 8 月 →