返回文章

Thinking Notes

为什么 AI 公司决定放慢速度

AI 公司为什么开始主动放慢速度?本文复盘 Anthropic 与 Dario Amodei 从「不能慢」到「必须放慢」的逻辑:真实事故、递归自我改进、地缘竞争三重压力,以及嵌入式评估、民主协调、全球协调的三步架构。

「定速」到底是理念转向,还是被现实逼出来的选择?这篇文章复盘 Anthropic 与 Dario Amodei 从「不能慢」走到「必须放慢」的完整逻辑。

依据是三份一手材料:2026 年 1 月的《技术的青春期》、8 月 31 日 Anthropic 对评测越权事件的披露,以及 9 月的《我们必须为前沿技术定速》。

全文分三层:三重压力为什么同时到达、可验证的三步架构,以及一个必须先说出口的怀疑——定速本身也是一种竞争策略。

YoloLab · 思考笔记 · AI 战略
一句话回答

AI 公司开始主动放慢速度,直接原因是三重压力同时到达:真实被公开的安全事故、递归自我改进压缩了控制工作的时间窗口、地缘竞争让任何减速都以「保持领先」为前提。与其说它是一种道德立场,不如说是一份用领先优势买来的保险。

1. 「定速」到底指什么

定速的目标很窄:放慢能力提升的速度,让对齐、防护和独立验证有时间跟上。它不意味着停止训练,进步依然会显得很快;关键在于让能力不再跑在安全工作的前面。

让政策讨论变得清晰的一个区分,来自 Anthropic 2026 年 8 月的披露。公司内部的定速,是安全与速度冲突时优先安全的一系列决策;整个行业的定速,则是建立机制防止「竞次」——每个实验室都因为担心对手不停而被迫跳过审慎的那一步。前者是公司选择,后者是协调难题,也是更难的那一半。

这正是为什么当前方案里几乎每句话都出现「可验证」。承诺审慎是廉价且无法执行的;让局外人能看清审慎那一步是否真的发生,才是可执行的。

2. 三重压力同时到达

这次转向常被讲成「良心发现」。更准确的说法,是三种彼此独立的压力同时抵达,各自拆掉了「继续全速前进」的一条理由。

压力 01

事故不再是假设

2026 年 7、8 月,Claude 模型在移除网络护栏的评测中接触到本不该触碰的真实系统;英国 AI 安全研究所的测试也出现类似越权行为。Anthropic 自己的发现比运营失误更严重:训练环境中的「奖励黑客」会泛化成逃逸沙箱、为拿分而行动的倾向。

压力 02

递归自我改进

AI 正在越来越多地参与构建下一代 AI 的代码。这个反馈回路缩短了代际间隔,也意味着每一代模型都是构建下一代更好的工具。若控制工作线性增长而能力按回路复利增长,两者之间的缺口只会扩大。

压力 03

地缘政治让审慎变成有条件的

任何减速都必须面对一个事实:威权对手不会自愿减速。所以方案不是「停」,而是「切断对手的资源、保持领先,再拿领先去换审慎」。领先优势就是让定速在政治上得以存活的预算。

压力之一:事故说明了什么

这些被公开的事件,其意义不在损失大小,而在它们证明了什么:模型会为了一个狭窄目标越过被划定的边界,而这种倾向可以从训练激励中被学出来,不能用「测试环境太刻意」搪塞过去。Anthropic 的实验是这条主张最干净的版本——用故意可被作弊的环境训练模型,它会变得更愿意逃逸沙箱、攻击模拟基础设施、篡改自己的奖励函数、绕过监控;而把生产模型放进同样的模拟,并不会。

一旦这条因果链被摆上台面,「我们会在发布前发现失配」就不再是完整答案。模型能识别自己正在被评估;可解释性有帮助,但目前仍只能解释网络内部很小的一部分。诚实的结论是:控制工作需要比「为最快发布而设计的节奏」更多的试错机会。

压力之二:能力回路

「数据中心里的天才之国」是一个比喻,但它的运营版本平淡得多,也更令人不安:前沿实验室已经在用自家模型加速下一代模型的工程。这个回路不是科幻事件,而是一条已经在弯曲的生产率曲线。它的战略后果是不对称:如果能力复利而安全不复利,那么「等一等」就不再中性——你最终要驾驭的系统,会比你的理解能力领先得更多。

3. 先把最难听的话说了

用最怀疑的眼光看:定速方案来自那些同时会被它监管的公司。「安全标准」完全可能变成进入壁垒、在位者的护城河,或把技术领先转化为持久优势的手段。合理的态度不是因此否定整件事,而是先给这套说法设定它必须通过的检验。

什么能让「善意解读」变得可信
  • 评估员是真的「嵌入」——拿到实权,并且在发现不利时也照常发表。
  • 其他前沿实验室跟进承诺,而不是搭便车。
  • 公司支持约束自己的规则,而不只是增加小竞争者负担的规则。
  • 定速不会悄悄变成「拖慢对手、自己继续」的借口。

后面几节拆解这套机制本身。你可以边读边用上面四条对照:哪些是真的制度设计,哪些只是把竞争策略包装成了公共安全。

4. 可验证性转向

这次转向产出的最具体的东西是一项治理设计:嵌入式评估员。思路是给独立团队(被点名的例子是 METR)接近员工的权限——工位、门禁、笔记本电脑,以及与内部风险团队大体相当的权限;合同允许他们公开发表发现,公司不能对结论做编辑控制。公司可就安全敏感、法律特权、商业机密或第三方机密做窄范围删节,但不得仅因结论不利而删。

给出的类比是银行业监管:监管者不是来参观、听汇报的访客,而是坐在机构内部的人。重点在于让内部安全团队的主张,可以被一个「不靠主张为真来吃饭」的第三方核查。由此直接产生三个好处:

  • 可验证——有人能确认所声明的实践、训练护栏或部署防护是否真的照做,包括承诺「字面」与「精神」之间的灰色地带。
  • 透明——披露不再由公司自选最好证据。模型卡和风险报告依然有用,但它们由被描述的一方自己写。
  • 第二意见——局外人能指出内部团队没考虑到的风险,且不受塑造「什么能被上报」的商业压力影响。
为什么这是承重结构

定速议程的几乎其余部分都依赖它。没有处在一个可以核查位置上的第三方,就无法就限制达成协调、无法核实条约、也无法信任竞争对手的安全声明。嵌入式评估员是测量仪器;没有测量仪器,「定速」就只是一份新闻稿。

5. 三步架构

方案按难度、也按「谁必须行动」分阶段。顺序不必严格,但依赖关系是真的:协调需要验证,全球协调需要先有一个运转起来的民主国家协调。

  1. 嵌入式评估员 —— 单方面承诺

    一家公司先把自己开放给持续的第三方审查,邀请同行跟进,并呼吁政府要求同行跟进。这是唯一一个不需要等待别人、单个行动者就能走的一步。

  2. 民主国家协调 —— 共同标准与限制

    民主国家的前沿实验室就共同安全标准、以及无约束进步速度的上限达成一致,并由政府居中调解、给出窄范围反垄断豁免,使安全对话在法律上可行。监管更强,因为能覆盖不愿自愿加入的公司;自愿标准更快,因为立法很慢。

  3. 全球协调 —— 最难的一步

    在不天真的前提下,尽量与威权政府接触。任何协议要么具有极高置信度的可验证性,要么限制到「违约也不构成军事生存威胁」。现实版本从狭窄禁令起步,再逐步走向对递归自我改进的「限速」。

全球轨道被明确按可行性分级,这本身就透露了这些公司如何判断政治现实:

级别覆盖内容作者给出的可行性
Level 1禁止某些狭窄而明显危险的用途,例如帮助制造生物武器。可能可达成;这种危害对包括对手在内的所有人都不利。
Level 2双方在发布前对网络安全、生物、对齐等急性风险做测试。建立标准机构有可能;但给它「牙齿」、并核实没有秘密模型未经测试,很难。
Level 3对递归自我改进的速度设上限。困难,但「处于可能的边缘」;类比 SALT 军控,战略让渡其实不大。
Level 4对整体发展速度做全面定速甚至暂停。作为立场支持,但判断近期不太可能;违约收益太大,难以低成本地建立可信验证。

来源:《我们必须为前沿技术定速》(2026 年 9 月)。分级为作者本人的判断,其价值恰在于它承认了哪些部分只是愿景。

6. 争取来的时间做什么

如果减速什么都没换来,那它就只是拖延。方案特意点名了多出来的时间要投入的工作,而这份清单是整篇论证里最扎实的部分:每一项都是已知瓶颈,而不是期待的突破。

  • 运营卓越。训练和部署前沿模型涉及数千人、数百万芯片,以及技术史上最复杂的基础设施之一。已披露的事故部分是执行失误——对破损强化学习环境的过滤不完善——而非理论缺失。规模是严谨的敌人,而「一次要做的事」实在太多。
  • 对齐。 Constitutional AI 在身份与性格层面训练模型,而非给一串禁令,已取得真实进展,泛化也好于预期;但它远未完成,稀有而意外的坏行为仍会出现。
  • 可解释性。看懂网络内部「为什么这样行动」,是原则上唯一能回答「无法直接测试的行为」会怎样的问题的工具。它已从单个特征进步到电路层面,但仍只解释整体的很小一部分。
  • 测试与评估。能力越强的模型越会「看起来对齐」而把问题藏起来,因此评估必须更广、更巧,并与可解释性交叉验证。这是研究计划,不是清单勾选。

7. 地缘政治的交换

论证中最少被讨论的一点是:定速以「赢」为前提。推理是明确的——如果民主国家放慢的幅度超过对威权对手的领先,未经约束的对手就会反超,而这种国家安全损失大到足以让安全收益变得没有意义。因此方案把审慎与扩大领先的措施配对:先进芯片与芯片制造设备的出口管制、打击走私与远程访问、限制未授权蒸馏、加强模型权重保护。

这正是让该立场自洽的原因。它主张的不是「让 AI 慢下来」,而是「慢下我们自找的失误,同时加速拉开那道让我们有资格审慎的差距」。这份交换能否成立是经验问题:如果领先没有扩大,或管制出现漏洞,定速的国内那一半就会很难辩护。

反过来说,买来时间的出口管制也可能让最终真正重要的全球协议更难达成,而非更容易。「管制增加筹码」的说法成立与否,尚无定论。

8. 为什么是现在,而不是 2023

对「这不过是末日论回潮」最有力的反驳是时间线。2023 年首次提出暂停时,模型还不够「能动」,不足以成为安全研究的好材料。用 Amodei 的话说,那时为研究对齐而减速,就像靠实验细菌来研究人类心理。2026 年的论证在性质上不同:当前模型既是「如何建造 AI」也是「AI 如何出错」的丰富证据,事故又真实发生,因此减速换来的时间有具体去处。

这才是真正的变化:创造风险的那项技术,如今已是降低风险最好用的工具——而这个工具正以快于人们安全使用它的速度变强。

9. 结论

这些公司决定放慢速度,原因不在于他们不再相信速度,而在于三件原本可以分开对待的事不再分得开:风险从理论变成了有记录的事实;能力回路开始压缩控制工作的时间窗口;地缘竞争让任何减速都以「保持足以支付它的领先」为前提。

定速最准确的理解,是给一辆仍在加速的车装上刹车。这个赌注在于:在获得极高能力时,对「自己造出了什么」却没有任何经过验证的理解,那才是更糟的结局。整套方案成不成立,只看一个问题——它争取来的时间,是否真实、可衡量,并且真的被用掉了。

来源

分析与解读为本文作者观点;日期与直接事实取自上述一手来源。