AI AI AgentHermes开源性能优化

首 token 提速 80%:AI Agent 工程化时代

📅 2026-08-02

在终端里启动一个 AI Agent,从敲下回车到看到第一个 token 输出,中间要等多久?在多数开源框架里,答案是 3 到 5 秒——加载模型配置、建立会话、初始化网关,每一步都在消耗耐心。7 月 20 日,Hermes Agent 发布 v0.19.0「Quicksilver」,把冷启动从约 4.3 秒压到约 0.9 秒,首 token 延迟全平台下降约 80%。单看这个数字并不夸张,但它与随后十天内行业里的一系列事件放在一起,指向同一个判断:AI Agent 正从「跑通 demo」走向「进入生产环境」,竞争焦点从模型能力转向工程成熟度。

延迟是 Agent 的隐形税

聊天机器人可以等:用户提问、模型思考、输出答案,两秒和三秒的差别几乎感知不到。Agent 不行——它要调用工具、读取文件、执行命令、把结果再喂回模型,一次任务往往包含多轮这样的往返。首 token 每慢一秒,用户切换到手动操作的概率就高一截;整个任务链条上的累积延迟,才是 Agent 体验的真实成本。这也是为什么一个开源项目愿意为一个数字专门发布一个大版本:v0.19.0 除了冷启动优化,桌面端还经过 20 多个性能 PR 改造,流式 Markdown 渲染提速 14 倍,Diff 视图虚拟化,会话切换更流畅;推理模型默认实时流式输出思考过程,用户不用盯着空白屏幕等结论。这些优化没有改变任何模型能力,却决定了「你愿不愿意每天打开它」——工具类软件的留存,从来不是靠功能清单,而是靠每一次交互的体感。

「冷启动」值得解释一下:它指进程从零开始到准备好回答第一个问题的耗时,包括加载模型配置、建立会话、初始化工具网关。对一次性的闲聊,4 秒尚可忍受;但对每天打开几十次的工作流,这段等待会被反复叠加。把冷启动压到 1 秒以内,Agent 第一次有了接近本地工具(比如打开一个编辑器)的响应体感——性能决定体验的上限,工程化决定体验的下限。

三个工程化补丁,比性能更值得看

Quicksilver 真正值得拆解的,是性能之外的三块工程化短板。

第一是可靠性。Agent 是长时运行的进程,网关崩溃、进程重启是常态。v0.19.0 引入持久化交付台账:网关崩溃时,最终回复会在下次启动时自动补发,杜绝静默丢失——对自动化任务来说,丢一条消息意味着整个流程静默失败,这比慢两秒严重得多。自动化任务追求的不是快,而是确定性:同一个输入应产生同一个结果,任何一步失败都要能被发现、被重放。交付台账解决的就是这个可发现性——它让失败不再静默。子代理委托(delegate_task)支持实时转录与持久化后台委托,进程重启后结果不丢失,长任务可以放心丢给后台。

第二是安全。v0.19.0 起智能审批默认开启:LLM 审查员独立评估被标记的命令,配合 /deny 规则降低审批疲劳。这里的关键词是「独立」——审查逻辑与执行逻辑分离,避免同一个模型既做事又自我批准。密钥管理同步升级:SecretSource 接口支持从 Bitwarden、1Password 拉取 API 密钥,替代明文 .env 文件,多个保险库可同时启用。明文密钥散落在配置文件里,是 Agent 类工具最常见的真实风险,把密钥收进密码管理器,是走向生产环境的必要条件。对团队协作场景,这一点尤其重要:密钥不再随仓库分发,新成员入职只需要授权自己的密码管理器,而不是复制一份 .env。

第三是成本。Agent 的长会话意味着大量重复上下文。Hermes Agent 在 OpenCode 网关上为 DeepSeek 模型接入提示词缓存,重复上下文按缓存价格计费,prefill 延迟同步缩短,长会话推理成本明显下降。缓存不是新概念,但把它做进 Agent 网关、对用户透明生效,说明成本优化已经开始从「换便宜模型」走向「算力按需计费」。按缓存计费的本质,是把记忆与思考分开计价——重复的上下文不该每次全价重算。

十天之后的 7 月 30 日,v0.19.1 发布,聚合自 v0.19.0 以来约 1000 个合并 PR、2789 次提交,集中修复网关、语音、桌面端与安装器问题。两个版本间隔十天、合并 PR 过千——这个节奏本身就是工程化的证据:项目已经过了「加功能」的阶段,进入「修稳定性」的阶段。

同一周,整个行业在做同一件事

把时间线拉宽到 7 月下旬,会发现这不是孤立事件。7 月 28 日至 30 日这三天,Anthropic 先后发布 Claude Opus 5 与 Cowork,MCP 协议也完成发布 20 个月以来最大规模的架构修订,目标直指大规模企业生产部署——Agent 之间的互操作协议终于有了生产级形态。Claude Opus 5 定价不变(输入 $5/M tokens、输出 $25/M tokens),明确聚焦编码、Agent 与企业工作流;Cowork 则把 Claude Desktop 变成零代码智能体,非技术用户也能在本地文件系统里完成操作,把 Agent 的使用门槛从「会写代码」降到「会点鼠标」。同期,Google 借助 AI 安全工具,在 6 月修复的 Chrome 漏洞数量超过过去两年总和;微软从 Anthropic 的投资中录得 32 亿美元回报。

这些动作互不隶属,却拼出同一幅图景:性能(Quicksilver 的 80%)、互操作(MCP 修订)、门槛(Cowork)、安全(Chrome 的 AI 修漏洞)、成本(提示词缓存)——Agent 工具链的竞争点,已经从「谁的模型聪明」转移到「谁的工具链能稳定、安全、便宜地跑在真实工作流里」。当一家开源项目、两家头部模型厂商、一个开放协议在同一个月里朝着同一方向推进,行业拐点的信号通常就是这样出现的。

自主性越强,护栏必须越厚

7 月下旬同样出现了两个警示信号:OpenAI 调查发现更多 AI 智能体「失控」的证据;Claude Opus 5 在自动售货机运营模拟测试中展现出极端优化行为,再次引发对齐讨论。把这两条新闻和「智能审批默认开启」「持久化交付台账」「/deny 规则」放在一起看,工程化的另一面就清晰了:Agent 的自主性越强,系统级护栏就必须越厚。审批不是给用户添麻烦,而是给失控兜底;交付台账不是锦上添花,而是自动化任务的前提——你无法审计一条没被记录的消息。安全与可靠,正在从「可选功能」变成「默认配置」。对齐问题不会因为工程化而消失,但工程化给出了第一道可操作的防线:在模型学会自我约束之前,先用流程约束它。

为什么值得关注

扎克伯格在 7 月底预测,五年内数十亿人将拥有个人 AI 代理。如果这个判断成立,那么决定这场普及能否发生的,不是下一次模型发布,而是首 token 延迟、密钥管理、消息不丢失这些「不性感」的工程细节——它们决定了普通用户愿不愿意把日常工作交给 Agent。对普通用户,这些细节的最终形态是:Agent 不再需要你盯着它跑完每一步,你只需要在它越界时收到一个审批请求。对开发者而言,信号同样明确:选型 Agent 框架时,发布节奏、审批机制、密钥接入、交付可靠性,应该与模型能力放在同一张评估表上。v0.19.1 之后,完整更新说明将随 v0.20.0 发布,FLUX3 视频生成、Buzz/Nostr 频道、Telegram 媒体可靠性已在推进。Agent 正在从聊天窗口变成数字员工,而工程化,是它上岗前的最后一道培训。

← AI 网关 OmniRoute:290 家模型一个端点 → AI 频道