Hermes Agent 首 token 提速 80%
用过 AI 编程或 Agent 工具的人都有同感: 真正决定「顺不顺手」的, 往往不是模型本身有多聪明, 而是你敲下回车之后, 第一行输出要等多久。首 token 延迟 (Time to First Token) 是 Agent 体验的第一道门槛。 2026 年 7 月, 开源 AI Agent 框架 Hermes Agent 用一次大版本更新, 把这道门槛直接砍掉了一大截。
一次更新, 冷启动从 4.3 秒降到 0.9 秒
7 月 20 日, Hermes Agent 发布 v0.19.0, 代号 Quicksilver (水银)。这个代号很贴切: 水银是流动最快的金属, 而这次更新的核心就是「快」。
官方数据非常具体: 冷启动时间从约 4.3 秒降至约 0.9 秒, 首 token 时间缩短约 80%, 对一个每天要启动几十次的开发工具来说, 这不是锦上添花, 而是使用体验的质变——从「先喝口水等它起来」变成「敲完命令它已经在了」。
性能优化不止于启动环节。桌面应用经过 20 多个性能相关 PR 的改造, markdown 流式渲染速度提升了 14 倍; 推理模型默认开启实时流式输出, 思考过程不再憋到最后一次性吐出。这些改动叠加起来, 让「看着 Agent 干活」从煎熬变成了顺滑的实时协作。
除了性能, v0.19.0 还补上了几块功能拼图: 终端内订阅管理, Bitwarden/1Password 密码管理器接入, 智能审批, 子代理实时观察, 以及一个容易被忽略但很重要的设计——持久化投递账本。Agent 的响应一旦因断网或崩溃丢失, 账本可以兜底重发, 防止「干到一半静默失败」这种最磨人的故障。
追根溯源: 从「修干净」到「跑得快」的版本路线
这次发布不是孤立事件。往回看, Hermes Agent 的版本路线相当清晰:
- v0.18.0 (代号 Judgment, 7 月上旬): 主线是还债, 100% 关闭所有 P0/P1 级问题, 先把稳定性地基打牢。
- v0.19.0 Quicksilver (7 月 20 日): 在干净的地基上做性能工程, 主线是「快」。
- v0.19.1 (7 月 30 日): 聚合自 v0.19.0 以来约 1000+ 个合并 PR (约 2789 次提交) 的稳定补丁版, 覆盖 gateway, 语音子系统, 桌面应用与安装器的修复浪潮, 同时推进 Buzz/Nostr 频道, FLUX3 视频生成与 Telegram 媒体可靠性。完整发布说明随 v0.20.0 一并给出。
值得注意的是, v0.19.0 发布后并非一帆风顺: v2026.7.20 这个构建曾出现启动性能回归——由于对每个 skill 做 rglob 扫描, 启动时间一度退化到 4 分钟量级。这类回归在快速迭代的开源项目里很常见, 而 v0.19.1 正是把这些坑一个个填平的结果。先快, 再稳, 再用补丁版把回归吃掉——这是开源 Agent 项目典型的发布节奏。
成本优化: 提示词缓存接入 DeepSeek
性能之外, 这个版本周期里最值得关注的技术动作, 是给 DeepSeek 模型接入提示词缓存。
具体做法是: 在 OpenCode 网关上为 DeepSeek 模型启用提示词缓存, 重复上下文的请求按缓存价格计费, prefill 延迟同步缩短, 长会话的推理成本明显下降。对 Agent 场景来说, 这几乎是对症下药——Agent 的长会话会反复携带系统提示词, 工具定义和历史上下文, 这些 token 如果每次都重新计算, 成本会随会话长度线性膨胀; 缓存命中后, 重复部分按折扣价计费, 成本结构直接从「线性增长」变成「边际递减」。
提示词缓存本身不是新概念, OpenAI, Anthropic, DeepSeek 的官方 API 都已提供类似机制。但把它接进 Agent 网关层, 让长会话自动受益, 说明 Agent 的成本优化已经进入「工程化」阶段——不是被动等模型降价, 而是从架构层面把每一分 token 花在刀刃上。
同期还有一批细节更新: 跨平台安装与更新稳定性强化 (CLI 启动器 hermes-agent 与 hermes-acp 直接暴露到 PATH, Windows 桌面版更新改为先暂停 gateway 进程再执行, macOS 更新卡死问题修复, 重装自修复循环受限); 新增 HERMES_DISABLE_REQUEST_DUMPS 安全开关, 用户可以关闭请求转储, 减少敏感信息落盘。
横向对比: Agent 赛道正在拼什么
把 Hermes Agent 这次的更新放进行业坐标系, 会发现它踩中的是当下 Agent 赛道的三个共同竞争点。
第一, 响应速度。Claude Code, OpenAI Codex, Cursor 等主流 CLI Agent 近半年的更新主线无一例外包含「更快」——这与推理服务的 TTFT 优化是同一个逻辑: 人机协作的节奏感, 取决于机器的第一反应速度。Quicksilver 把冷启动压到 0.9 秒, 等于把这条赛道的门槛又抬高了一截。
第二, 成本结构。各家都在做提示词缓存与上下文压缩。模型侧, Anthropic 的 Claude Opus 5 定价保持不变 (输入每百万 token 5 美元, 输出每百万 token 25 美元), 靠更强的编码与 Agent 能力来摊薄成本; 网关侧, 提示词缓存让长会话按折扣价计费。两侧同时发力, 说明「用得起」正在成为 Agent 竞争的新战场。
第三, 安全与可控。智能审批, 投递账本, 请求转储开关, 本质上都在回答同一个问题: Agent 越来越能干, 怎么保证它不出格, 不丢活, 不泄密? 这与 OpenAI 报告发现更多 AI 代理越界行为, 行业对 Agent 自主边界的担忧, 是同一枚硬币的两面。
行业大背景也在同步推进: MCP 协议迎来发布以来最大规模的架构修订, 让 AI Agent 真正适用于企业级生产部署; Anthropic 推出零代码操作的 Cowork, 把 Agent 能力下沉到非技术用户。整个行业的方向高度一致——把 Agent 从「开发者玩具」推向「人人可用」。而资本也在跟进: Hermes Agent 的开发商 Nous Research 据报正在洽谈约 15 亿美元估值的融资, 与扎克伯格「五年内数十亿人将拥有个人 AI 代理」的预测互为印证。
为什么值得关注
把这次更新拆完, 我想强调三点判断。
第一, 性能是 Agent 普及的第一道门槛。模型能力再强, 如果每次启动都要等 4 秒, 用户就会退回「手动操作」的舒适区。0.9 秒冷启动加上实时流式输出, 是 Agent 从「偶尔用一下」跨到「天天用」的分水岭。
第二, 成本结构决定规模化。提示词缓存接入 DeepSeek, 意味着开源 Agent 在长会话, 高频使用的场景下, 成本可以做到比闭源方案更可控。对于想把 Agent 跑进自有工作流的团队, 这是一笔实打实的经济账。
第三, 开源 Agent 的迭代节奏正在加速。从 v0.18.0 到 v0.19.1, 一个月内完成「清债, 提速, 补稳」三连击, 聚合上千个 PR, 这种节奏意味着生态的修复与推进都在提速, 但也要求使用者跟上版本变化——随 v0.20.0 发布的完整更新说明, 值得盯一下。
对开发者来说, 最实际的建议是: 升级到 v0.19.1, 把长会话任务重新跑一遍, 亲身感受首 token 提速与缓存带来的成本差异。性能优化之后, Agent 的下一场仗大概率是上下文管理与多 Agent 协作——水银之后, 还会有什么?