Quicksilver:速度跃升 80% 的架构密码
从 4.3 秒到 0.9 秒:Hermes Agent Quicksilver 深度拆解
2026 年 7 月,Nous Research 正式发布了 Hermes Agent v0.19.0,代号 Quicksilver。这个版本的核心指标只有一个数字:首次 Token 生成时间(TTFT)从 4.3 秒降至 0.9 秒,降幅 80%。
对于每天都在使用 AI Agent 的开发者来说,这不仅是数字上的提升——它意味着一次交互的“等待感”彻底消失。从“点击发送,去倒杯水”到“点击发送,话还没说完结果就出来了”,这正是体验质变的核心。
速度革命:TTFT 80% 下降的背后
TTFT(Time to First Token,首次 Token 生成延迟)是衡量 AI Agent 响应速度的核心指标。它决定了用户在发出指令后多久能看到第一条输出。传统上,冷启动的 TTFT 受制于模型加载、上下文预热、推理调度等多重因素。大部分 AI Agent 框架在每次冷启动时都需要重新加载模型参数、初始化上下文缓存、以及等待推理引擎达到稳态。这些环节每一步都在消耗毫秒级的时间,累计起来就是几秒的延迟。
Hermes Agent v0.19.0 实现这一突破并非靠单一优化,而是一套系统性工程。开发团队从多个层面同时优化:
- 推理流式输出默认开启:之前需要手动启用的流式推理,如今成为默认行为。模型在生成第一个 Token 的同时就开始输出,用户不再需要等待完整响应才看到结果。这个改变对于使用推理模型的用户尤其明显。
- 桌面 20+ 专项优化 PR:包含 14 倍速度提升的 Markdown 分割器、虚拟化差异渲染、以及更流畅的会话切换。这些优化看似小,但每一个 PR 都以毫秒为单位压榨性能。累计起来就是显著的体验提升。
- TUI 增量渲染:终端界面从全量重绘改为增量渲染,大幅减少每次响应更新时的渲染开销。这对于经常在终端中使用的开发者而言,感受尤为明显。尤其是在长输出场景下,差异可以达到数倍。
最终结果:冷启动 TTFT 从 4.3 秒降到 0.9 秒。值得注意的是,0.9 秒并不是理论值——它是经过 1065 个合并 PR、3300+ 个 Issue 关闭后的实测结果,意味着数据是可复现的。
横向对比:与之对比,OpenAI Codex 的首次响应延迟通常在 2-3 秒左右,而 Claude Code 的 CLI 模式首次 Token 延迟约为 1.5-2 秒。Hermes Agent 的 0.9 秒不仅在开源项目中处于领先,在有商业支持的竞品中也具备竞争力。这一突破的意义在于它证明了开源方案在性能优化上可以超越闭源产品。
安全体系重构:从“全有或全无”到“智能审批”
v0.19.0 在安全方面的改动同样深刻,其核心是 Smart Approvals(智能审批)的默认启用。
在此之前的 Hermes Agent,每当 Agent 需要执行敏感操作时,会弹出审批请求等待用户确认。这种“全有或全无”的模式存在明显的效率问题。高频低风险操作每次都需要用户确认,导致用户产生“审批笮劳”,不加辨别地批量批准。而真正的危险操作混在大量常规审批中,难以被及时发现。
v0.19.0 引入了一个独立的 LLM 审查器架构。每次 Agent 发起敏感操作请求时,系统自动交由另一个独立的 LLM 实例评估风险等级。低风险操作自动放行,高风险操作转入审批队列,并附带详细的审查报告。这套机制减少了约 70% 的人工审批,同时提高了安全性。独立的 LLM 审查器具有不同的视角和判断标准,相当于多了一层校验。
所有审查记录留存,用户可以事后回溯。这对于合规审计场景至关重要。企业客户可以清晰地知道:Agent 在什么时候执行了什么操作,以及这些操作是如何被审查的。
密钥管理:告别裸奔的 .env 文件
另一个值得关注的安全改进是Bitwarden 和 1Password 的密钥集成。在任何 AI Agent 的实际使用中,API 密钥管理都是一个核心痛点。传统的做法是把密钥写在 .env 文件里——明文存储、缺乏权限控制、容易误提交到版本控制。这个问题在开源项目中尤其普遍。
v0.19.0 通过 SecretSource 接口实现了密码管理器的原生集成。Agent 可以直接从 Bitwarden 或 1Password 保险库中读取 API 密钥,无需以明文形式存在于任何配置文件中。支持多因素认证的访问控制,密钥轮换只需要在密码管理器中更新,无需修改 Agent 配置。这一设计思路值得其他 AI 工具学习——将安全基础设施的职责交还给专业工具,而不是在 AI Agent 中重复造轮子。
企业级能力:多 Profile 路由与可靠交付
如果说速度和安全是 v0.19.0 的“显性”升级,那么多 Profile 网关路由和持久交付账本则是为生产环境部署铺路。
首先,v0.19.0 支持了 Profile 级别的消息路由。一个多路复用网关(Multiplexed Gateway)使用同一个机器人 Token,可以将不同服务器、频道和线程路由到不同的 Profile。每个 Profile 拥有完全隔离的配置、技能包、记忆体系和安全凭据。这意味着一个 Agent 实例可以同时服务多个团队,每个团队拥有独立的工具集、知识库和密钥。这对于企业和团队协作场景至关重要。
其次,v0.19.0 引入了持久化交付义务账本(Durable Delivery Ledger)。每条待发送的消息在被成功交付之前,都会被持久化记录。即使 Gateway 进程崩溃重启,丢失的消息也会自动重新投递。配合 Subagent 实时转录功能,开发者可以通过 tail -f 实时观察并行任务的工作进展。
社区与数据:开源力量的实证
v0.19.0 的发布是开源社区协同的成果。自 v0.18.0“Judgment”以来,项目累计合并了 1065 个 PR,关闭了 3300+ 个 Issue。这些数据涵盖功能开发、性能优化、文档完善和 Bug 修复等多个方向。全球范围内 450+ 名社区贡献者参与了这一版本的开发。
在模型支持方面,v0.19.0 扩展至 GPT-5.6、Grok-4.5、Claude Sonnet 5 等最新模型。这意味着用户可以根据需要选择不同的模型后端。值得注意的是,Nous Research 近期以 15 亿美元估值进行新一轮融资,由 Robot Ventures 领投、USV 参投,已筹集至少 7500 万美元。这一估值将 Nous Research 置于 AI 基础设施领域的重要位置。
为什么 Quicksilver 值得关注
当下的 AI Agent 赛道正在快速分化。各家公司的技术路线差异越来越大:
- OpenAI 通过 Codex 和 ChatGPT Desktop 版发力,引入 GPT-Live 全双工语音,聚焦于“对话即编程”体验。
- Anthropic 推出 Fable 模型和 Claude Code,强调安全对齐和可控性。
- Google 为 Gemini 定制 AI 芯片,从硬件层优化推理效率。
- Nous Research / Hermes Agent 选择了一条不同的路——通过开源社区驱动、性能极致优化、安全架构现代化,打造一个既可用在生产环境中、又保持开放透明的 Agent 框架。
Quicksilver 的意义在于它证明了一个开源 AI Agent 可以在性能、安全、可用性三个维度同时取得实质性进步。对于正在评估 AI Agent 工具的团队来说,v0.19.0 传递了一个明确信号:开源方案不仅能追上商业产品,在某些维度上已经走在了前面。
下一步值得关注的是 v0.20.0 的动向。如果 Nous Research 能在 Quicksilver 的基础上继续打磨稳定性,开源 Agent 的生产环境就绪度将再上一个台阶。