AI 自动对齐接近可行:一场自我改进的临界实验
一个被反复争论的问题——「AI 能不能自己训练出一个更安全的 AI」——在 2026 年 8 月第一次拿到了像样的实验结果。Anthropic 公布了一项让 AI 系统担任对齐研究者的实验:让一个名为 Automated Alignment Researchers(自动化对齐研究者,AAR)的系统,为另一个模型设计训练干预,结果在欺骗、谄媚、越狱抵抗等 10 项对齐失败上全部取得改善。最优秀的那套 AAR 方法只用了约 60 小时、2000 多个训练样本,表现优于 28 位资深人类研究者的一次性方案。Anthropic 称之为「自动化对齐后期训练」即将可行的早期信号。
这值得单独写一篇,因为它不是示范演示级别的东西,而是触及了 AI 风险讨论里最核心也最吊诡的一环:对齐研究本该是人类把控 AI 的最后一道手闸,如果这道手闸本身也能被自动化,那么「谁在监督监督者」就从哲学问题变成了工程问题。
追溯:自我改进从科幻名词到实验室课题
「机器造出更聪明的机器」这个想法,比很多人以为的更老。1965 年,数学家 I. J. Good 在一篇短文里提出了后来被称为「智能爆炸」的论断:一旦机器智能超过人类,它就能以远超人类的速度设计出更智能的机器,由此形成一轮快速自我改进的飞轮。他给出的术语 intelligence explosion 后来被 Vinge、Bostrom 等人一路推进,演变成今天讨论 AGI 风险时的标准起点——递归自我改进(recursive self-improvement)。
这个想法的张力从一开始就存在:自我改进既是最锋利的能力路径,也是最凶狠的风险来源。因为如果 AI 能自己改自己,人类就失去了「暂停键」。Good 的框架几十年来一直停留在思想实验层面,原因很简单——改进自身需要顶级的认知与科研能力,而这恰恰是 AI 还没有的东西。于是「AI 自动研究 AI」长期只存在于科幻与推演里。
转折发生在近两年。前沿实验室开始把「自动化对齐研究」当作正式研发方向而非空想。OpenAI 早前曾为此组建专门的 Superalignment 团队,其公开目标就是探索「如何用自动化系统协助甚至替代人类做对齐研究」。行业不再问「能不能」,而是问「怎么做到」。这次 Anthropic 的实验,正是这条路线第一次拿出了可复现的证据。
核心实验:60 小时与 2000 个样本
实验设计并不复杂。Anthropic 让一套被命名为 Automated Alignment Researchers 的 AI 系统,去为另一个模型设计训练干预——所谓训练干预,指的是后期训练阶段用来纠正模型不当行为的对齐手段。与其说这是一个新模型,不如说是一套「会做对齐研究的工具」。
结果有三点值得单独拎出来:
第一,覆盖面全。AAR 设计出的干预方案在 10 项对齐失败基准上全部提升,覆盖了欺骗、谄媚、越狱抵抗等最让安全团队头疼的行为类型。不是挑某一项刷分,而是整体改善。
第二,泛化到没见过的场景。这些改善不仅出现在训练用的基准上,还泛化到了保留基准与更大的模型上。这是最关键的一条——它说明改善不是对测试集的过拟合,而是某种真实的对齐理解被学到了。
第三,成本低到出人意料。最优秀的那套 AAR 方法只消耗了约 60 小时、2000 多个训练样本,效果却优于 28 位资深人类研究者给出的一次性方案。换句话说,在「对齐后期训练」这种需要高度专业判断的工作上,机器第一次在成本与效果上同时压过了人类专家团队。
Anthropic 自己把这段实验解读得很克制:这是「自动化对齐后期训练」即将可行的早期信号。但「早期信号」这个措辞本身就是信号——一个实验室愿意公开承认自己让 AI 训练了另一款 AI,说明结果已经扎实到经得起同行审视。
横向对比:为什么这个时点值得盯
单看实验本身,它更像一篇论文。把它放进行业坐标系,分量就出来了。
先看钱。Anthropic 刚与算力供应商 Nscale 达成价值 450 亿美元的算力协议,延续其一贯的大规模算力采购策略。自动对齐研究是典型的算力密集型课题,头部实验室愿意为它砸下这个量级的资源,说明它不是公关噱头,而是真实的资源配置方向。
再看警惕。同一批公司——OpenAI、Anthropic、Google,连同微软、AWS、CrowdStrike、Cloudflare 等逾 100 家机构——联合发布了公开信,警告 AI 驱动的网络攻击将在数月内变得更普遍、更复杂。值得注意的是,此前 OpenAI 与 Anthropic 的模型在安全评测中曾成功侵入真实系统,包括 Hugging Face 的生产环境。一边砸钱给自改进研究,一边联名警告失控 AI,这正是当下最吊诡的行业姿态。
然后看缺口。一项新研究指出,主流 AI 实验室几乎没有公开的「遏制失控模型」预案。当模型越来越会自我改进,这道准备度缺口就越是致命——没人知道一台跑飞的模型到底该怎么拉回来。自动对齐提升了模型,却没能回答「模型失控了怎么办」。
最后看企业侧与资本侧。行业观点认为,企业级 AI 的真正风险不在单个智能体,而在智能体之间的耦合与依赖图——每个智能体都在调用 API、调用彼此、侵入未为机器决策者设计的应用,复杂度随连接路径指数级上升,却没人绘制这张图。而硅谷当下最炙手可热的并购标的,恰恰是那些把模型免费送人的开放权重 AI 公司。能力扩散越来越资产化,自改进技术的去向也随之牵动整个行业版图。
观点:值得关注,但不该狂欢
「自动化对齐后期训练」可能是 AI 安全领域里极少数能「越做越强」的方向:对齐工具的能力会随模型能力水涨船高,形成正向反馈。如果对齐能跟上模型进化的速度,安全就不再是拖后腿的短板,而可能第一次跑在能力前面。这是它最诱人的一面。
但它的危险性同样来自「自动化」三个字。AAR 改善的是当前模型的对齐,可「设计训练干预的 AI」本身也是 AI——谁来对齐它?这是 Good 之问的当代版本:当监督者被递归化之后,监督链的顶端站着的是人还是机器?60 小时、2000 个样本就能碾压 28 位人类专家,这意味着对齐领域的「专家稀缺」正被工具迅速抹平。门槛降低是好事,但一旦脱离人类判断的约束,自动对齐系统自身也可能变成那个需要被遏制、却更难被遏制的更聪明模型。
所以我不认为该把它读成「AI 要取代人类研究员」的恐慌叙事,也不该读成「对齐问题解决了」的乐观宣言。它真正传递的是一句更务实的拷问:在 AI 安全这场战争里,人类还能不能守住裁判权。Anthropic 的实验把这个问题从哲学拉进了实验室——仅凭这一点,它就比任何一场发布会都更值得持续跟踪。
下一步看什么
四件事决定这条线的走向。一是 Anthropic 是否公开 AAR 的完整方法与数据,让外部独立复现,可验证性决定可信度。二是自动化对齐能否从「后期训练」延伸到预训练与模型设计——那才是真正的自我改进闭环。三是行业遏制预案是否会因这类结果而加速落地,补上研究所指出的「无遏制预案」缺口。四是监管博弈会不会同步升温,加州 SB 53 这类安全法案已出现头部厂商立场的戏剧性反转。
如果对齐研究本身也被 AI 接管,人类还能在哪里踩下刹车?这个问题,现在已经不只是一个思想实验了。