Hermes Agent 提速 80%:代理的延迟竞赛
用 AI 代理干活的人,大概都经历过这样的时刻:指令发出去了,界面上一片空白,光标闪了四五秒,你开始怀疑它是不是卡死了。模型再聪明,如果第一个字迟迟不来,体验就归零。这正是首 token 延迟(Time To First Token,TTFT)成为 AI 代理行业关键指标的原因——它直接决定人机协作的节奏。
7 月下旬,开源 AI 代理 Hermes Agent 发布 v0.19.0「Quicksilver」版本,把这个数字从 4.3 秒压到 0.9 秒,降幅约 80%。7 月 30 日,v0.19.1 补丁版跟进,把 v0.19.0 以来的 1000 余个合并 PR 打包成稳定版本。当头部厂商还在比拼模型参数与价格时,一个开源代理项目选择把火力对准响应速度,这件事本身值得拆开来看。
一、4.3 秒到 0.9 秒:一次针对等待的工程进攻
TTFT 衡量从用户发出指令到模型吐出第一个字的时间。在聊天场景里,它只影响一次体验;在代理场景里,代价被放大了——代理的一次任务往往包含多轮工具调用,每一轮都要重新经过思考、输出、执行、再思考的链路,延迟成倍叠加。一个每轮响应慢 3 秒的代理,跑完一个 10 步任务,用户要多等半分钟。所以 TTFT 不只是体感问题,它是代理效率的底数。
Quicksilver 的优化不是单点修补,而是整条链路的工程动作:
- 推理模型默认实时流式输出思维过程,等待不再是黑屏;
- 桌面应用经 20 多个性能优化 PR 重构,流式 Markdown 渲染快 14 倍,diff 改为虚拟化渲染,会话切换不再卡顿;
- 首次响应延迟在所有平台上平均降低约 80%。
4.3 秒恰好卡在人类耐心的临界点上:交互设计领域普遍引用的经验值是,超过 2 秒用户就会感知到延迟,超过 4 秒就会怀疑任务失败。把 TTFT 压进 1 秒以内,意味着代理第一次有了本地软件的响应感。对把代理当日常生产力的用户来说,这是从能忍到顺手的差别。
二、追根溯源:一条清晰的时间线
- 7 月中旬,TechCrunch 报道 Nous Research(Hermes Agent 的开发方)正在洽谈新一轮融资,估值 15 亿美元;
- 7 月 20 日,v0.19.0「Quicksilver」发布(版本标签 v2026.7.20);
- 7 月 30 日,v0.19.1 发布,汇总 v0.19.0 以来的约 1000 个合并 PR,覆盖网关、语音子系统、桌面应用与安装器的大量修复,以及 Buzz/Nostr 频道、FLUX3 视频生成、Telegram 媒体可靠性等平台改进。
再往前看,v0.18.0「Judgment」版本宣称 100% 关闭了所有 P0/P1 级问题。从清问题、提速度到收稳定性,发布节奏非常工程化:大版本立标杆,小版本收尾。这种持续交付能力本身就是项目进入成熟期的信号——没有稳定的发布节奏,谈不上体验优化。值得注意的是,融资传闻与版本迭代几乎同步:7 月中旬 TechCrunch 报道的 15 亿美元估值洽谈,就发生在 Quicksilver 发布前一周。资本对开源代理的关注,与产品的工程节奏形成呼应——速度、安全、稳定,正是投资人判断一个代理项目能否规模化的三个标尺。
三、比速度更值得注意的:安全与可靠性基建
Quicksilver 的另一半内容,是安全与可靠性,而不是速度:
- 新增可插拔的 SecretSource 接口,原生支持从 Bitwarden 和 1Password 读取 API Key 等敏感配置,告别明文 .env 文件;支持多个密码仓库同时启用、确定性优先级排序与变量溯源;
- 智能审批默认开启,用户可自定义拒绝规则;
- 新增持久化投递账本,防止响应丢失;
- 子代理支持实时观察与日志追踪。
这几项放在一起,指向一个判断:AI 代理正在从能跑走向能管。当代理开始持有密钥、自动执行审批、在后台调度子任务时,密钥管理、权限边界、执行审计就成了比模型能力更前置的问题。把密钥从 .env 挪进密码管理器,本质上是把代理当作一名正式员工来管理——这是企业级采用的前提。同期 Google 也在验证 AI 在安全侧的价值:2026 年 6 月借助 AI 工具修复的 Chrome 漏洞,超过了过去两年的总和。安全与 AI 的双向渗透,正在成为行业共识。
四、横向对比:整个行业都在向代理层迁移
Hermes Agent 的动作不是孤例,7 月下旬的几件事拼在一起,能看到一条清晰的主线:
- Anthropic 发布 Claude Opus 5,定价不变(输入 5 美元/百万 token,输出 25 美元/百万 token),明确面向编码、Agent 与企业工作流;
- Anthropic 同步推出 Cowork,把 Claude Desktop 扩展成无需写代码、直接在本地文件系统工作的桌面代理,对标 Claude Code 的桌面化版本;
- MCP 协议迎来发布 20 个月以来最大规模的架构更新,官方口径是让 AI 代理终于准备好大规模企业级生产部署;
- OpenAI 发布 Presence 企业级实时语音智能体平台。
头部玩家的竞争焦点,正在从模型本身转移到代理层:更低的延迟、更顺滑的桌面体验、更完善的安全机制、更标准的互操作协议。模型能力趋于同质化之后,代理的工程体验成为新的分水岭。
而 Hermes Agent 作为开源阵营的代表,选择用 80% 的延迟优化确立自己在体验上的位置。它同时支持 GPT-5.6,Grok-4.5,Claude Sonnet 5 等多个模型,新增 Fireworks AI 与 DeepInfra 等模型提供商——不绑定单一模型,做一个模型中立的代理层。在模型快速迭代的窗口期,这种中立性本身就是差异化:模型可以随时换,体验和流程是自己的。
五、观点:为什么值得关注
第一,延迟是代理体验的水电煤。模型再强,响应 5 秒起步的代理也撑不起日常高频使用。Quicksilver 把 TTFT 压进 1 秒,等于把代理从偶尔用用的工具推进了每天打开的生产力工具阵营。这个判断有数据支撑:80% 的降幅不是某一项优化的功劳,而是从模型调用到界面渲染全链路重构的结果,意味着这个速度是可持续的,不是营销数字。简单算一笔账:如果一次多步任务包含 10 次交互,每次等待从 4.3 秒降到 0.9 秒,总等待时间就从约 43 秒缩到约 9 秒。在多步任务里,延迟的代价是叠加的——这才是 80% 这个数字的真正分量。
第二,安全基建决定代理能走多远。密钥管理、审批机制、执行账本——这些不性感的工程,恰恰是代理进入企业流程的硬门槛。Hermes Agent 这版在安全上的投入,比速度优化更值得行业注意。
第三,开源代理正在建立自己的生态位。以 15 亿美元估值洽谈融资的 Nous Research,走的是开源核心加模型中立的路线。在闭源厂商用生态锁定用户的当下,开源代理给了开发者和企业一个可审计、可掌控的选项。
结语
白物集的内容管线本身就跑在 Hermes Agent 上,这次更新的直接感受是:同样的任务,等待明显变短,节奏顺畅了不少。当代理的响应逼近本地软件,人机协作的下一个瓶颈,可能就轮到人类自己的输入速度了。你上一次因为等 AI 响应而放弃某个工具,是什么时候?