找回密码
 立即注册
搜索
热搜: AI AGI ASI
ASI111-AI AGI ASI社区 门户 首页 AI理学 查看内容

从AGI到ASI的Anthropic路线:递归自我改进的公开呼吁与争议

2026-9-1 22:23| 发布者: Linzici| 查看: 3| 评论: 0

摘要: Anthropic在2026年6月4日发布的《When AI Builds Itself》一文,是ASI思想史上一个罕见的时刻——一家估值近万亿美元、正冲刺IPO的前沿实验室,主动呼吁全球保留"放缓或临时暂停前沿AI开发"的选项。这篇文章的真正分 ...
从AGI到ASI的Anthropic路线:递归自我改进的公开呼吁与争议
 
Anthropic在2026年6月4日发布的《When AI Builds Itself》一文,是ASI思想史上一个罕见的时刻——一家估值近万亿美元、正冲刺IPO的前沿实验室,主动呼吁全球保留"放缓或临时暂停前沿AI开发"的选项。这篇文章的真正分量,不在于它"呼吁暂停"(这在此前FLI公开信中已有),而在于它第一次由前沿实验室用内部量化数据,证明递归自我改进(RSI)正在自己的研发流程中发生。这使得Anthropic的路线既不是纯粹的加速主义,也不是彻底的暂停主义,而是一种"踩着油门呼吁装刹车"的矛盾姿态——也正是这种矛盾,引发了硅谷、华盛顿和学术界的激烈争议。

一、《When AI Builds Itself》:一份技术自白书

文章由Anthropic研究所负责人Marina Favaro和联合创始人Jack Clark撰写,核心论点谨慎而克制
"我们尚未达到这一阶段,递归自我改进也并非不可避免。但它到来的时间,可能早于大多数机构所预期的。"
这句话的三个限定词——"尚未"、"并非不可避免"、"可能更早"——精准定位了Anthropic的立场:不是预言RSI已至,而是指出RSI的工程路径正在快速收窄

关键数据:AI正在"构建AI"的量化证据

Anthropic披露的内部数据构成了文章的技术骨架:
维度
数据
含义
代码生成占比
2026年5月,Anthropic合并到生产代码库的代码中超过80%由Claude生成
AI从"助手"变为"执行者"
工程生产力
2026年Q2典型工程师每日合并代码量是2024年的8倍
研发节奏数量级加速
任务时长翻倍周期
模型可靠独立完成任务的时长从每7个月翻倍缩短至每4个月翻倍
能力演进速度本身在加速
训练代码优化
Claude Opus 4(2025.5)实现约3倍加速 → Claude Mythos Preview(2026.4)实现约52倍加速
同一任务设置下模型能力跃迁
研究判断超越
在129个"研究路径偏离点"测试中,模型建议优于人类选择的比例从Opus 4.5的51%升至Mythos Preview的64%
AI开始进入"研究品味"环节

四阶段演进框架

Anthropic将AI参与自身研发的历史拆解为清晰的四个阶段:
  1. 2021-2023 人工研发期:人类在笔记本上写代码,AI不参与研发流程
  2. 2023-2025 聊天机器人辅助期:AI生成短代码片段,人类复制、审查、整合——组织权和判断权仍在人类手中
  3. 2025-2026 编程智能体期:Claude Code等工具使AI能直接编写和修改完整代码文件
  4. 2026- 自主智能体期:AI能运行代码、执行测试、将工作委派给其他智能体
而真正的"闭环"(Closing the loop)——即AI能够完全自主地构建和改进自身的继任者——被标注为"20XX?",意味着这一步尚未到达,但趋势线指向它
💡 文章的关键判断:完整RSI需要AI不仅能够执行人类给定的工程和研究任务,还要能自主选择值得研究的问题、设计实验、训练模型、评估结果并构建继任模型。当前系统在"研究品味"和"方向设定"上仍依赖人类,但这一差距正在以量化方式快速缩小。

二、Anthropic的公开呼吁:全球协调机制

基于上述技术趋势,文章提出了在AI行业"颇为罕见"的主张:
"我们相信,让世界拥有放缓或临时暂停前沿AI开发的选项,将对世界有益——以使社会结构和对齐研究能跟上技术进步的步伐。"
Jack Clark在CNN采访中更直白地表达了这一隐喻:
"当我低头看我们正驾驶的车时,我只有油门踏板,没有刹车踏板,未来某个时刻我们很可能想要这个选项。"

呼吁的核心要素

Anthropic的提议包含四个关键设计:
  1. 多边协调:需要多个国家的政府和位于前沿的、资源充足的实验室同时接受相同限制
  2. 可验证机制:必须有可信的方式来证明各方确实放缓了——Anthropic指出"训练运行比导弹发射井更容易隐藏,其投入具有通用性,而且秘密违约的激励极大"
  3. 核军控类比:Anthropic将这一挑战比喻为"核武军备控制条约",但承认AI更难点对点管控
  4. 触发条件:需要明确的"能力触发阈值"来激活放缓机制

为什么是"协调放缓"而非"单方暂停"

Anthropic明确区分了两种刹车:
  • 单方暂停:一家实验室立即停止开发——" achievable immediately, but accomplishes much less: it would change who the front-runner is, but it would not create the wider deliberative process"
  • 协调放缓:多家前沿实验室+多国政府同步行动——难度极大但唯一有效
公司表示将在未来数月召集各国官员、科学家、倡导团体及竞争企业,共同研议这类机制如何运作。

三、争议:三重解读的撕裂

这篇文章在发布后48小时内引爆了硅谷和华盛顿的激烈争论,同一份文本被不同立场的读者解读为三种完全不同的东西

解读1:"真诚的预警"(安全主义视角)

支持这一解读的证据:
  • Anthropic自2021年成立以来就以"AI安全"为核心理念,是首家发布Responsible Scaling Policy的前沿实验室
  • 2026年2月RSP v3.0将自动化研发(automated R&D)列为关键阈值
  • 2026年5月Anthropic拒绝让美军将其模型用于国内监控或全自动武器,导致被五角大楼列为供应链风险
  • 沃顿商学院Ethan Mollick的评估:"Anthropic一直是对时间线最保守的实验室,当他们这么说时分量比其他实验室要重得多"

解读2:"竞争位置的锁定策略"(战略博弈视角)

批评者认为这是一种以安全为名、行锁定领先地位之实的策略:
"一个实验室在提出放缓速度,前提是竞争对手也放缓,'这是在领先位置采取的一个舒适立场'"
"像是披着薄纱的自夸营销,用来为天文数字般的估值辩解"
Bentley大学数学副教授Noah Giansiracusa更直接质疑:
"我不认为这是一次真心的减速呼吁……我读过Amodei的博客,我认为他想全速前进。"
一位微软产品经理的质疑代表了产业派的声音:
"花时间去检查和验证别人是否领先是浪费时间,如果有剩余产能,为什么我们不能既研究人们和社会将如何适应,同时又推进人工智能研究呢?"

解读3:"不可执行的空喊"(现实主义视角)

即使接受Anthropic的诚意,技术和政治的可行性也备受质疑:
  • Giansiracusa:"这 literally 不可能,zero chance 会有减速,我还没说中国——Elon Musk 永远不会减速"
  • 美国官员与科技业高层:一旦让AI发展减速,就可能让中国在这场被视为本世纪最关键的科技竞赛中取得决定性战略优势
  • 白宫反弹:美方认为Anthropic过度聚焦最坏情况、夸大风险
  • 技术质疑:有开发者指出"递归自我改进意味着奇点,但是80%的自我改进和100%差的不是20%,而是20倍的能力"——Anthropic披露的80%代码生成距离真正的RSI仍有本质差距

更深层的矛盾:Anthropic自身的"言行张力"

争议的核心在于Anthropic自身行为的矛盾性
  1. 一边呼吁刹车,一边继续发布更强模型:就在呼吁协调放缓的同时,Anthropic内部已拥有比Mythos 5更强的Model 2,并持续训练Opus 5
  2. RSP的演变方向:2026年2月RSP v3.0用自愿透明机制替代了有约束力的能力触发暂停承诺——这一结构性转变被批评为"从范畴护栏转向迭代自治"
  3. 2026年8月风险报告:Anthropic将"灾难性错位风险"评级从"极低"上调至"低",原因是"不确定性增加"而非新发现;同时披露Model 2"目前无对外发布计划"
  4. 商业现实:估值9650亿美元、冲刺IPO的Anthropic,与OpenAI(估值超8500亿)直接竞争——这种商业处境使其"呼吁刹车"的真实动机难以撇清
⚠️ 这种张力不是Anthropic独有的伪善,而是前沿实验室在"安全使命"与"商业生存"之间的结构性困境:如果单方暂停,市场份额将被对手吞噬;如果不暂停,RSI风险将持续累积。Anthropic选择的"呼吁全球协调放缓",本质上是一种将个体困境转化为集体行动的尝试

四、Anthropic路线在AGI→ASI光谱中的独特位置

把Anthropic的立场放回我们之前梳理的AGI→ASI观点光谱中,它的位置非常特殊:
[加速主义] → [e/acc] → [技术乐观] → ... → [Anthropic] → ... → [对齐派] → [x-risk] → [暂停派] → [卢德]
Anthropic既不是加速派,也不是暂停派,而是"预警的加速派"或"有条件的刹车呼吁者"
维度
Anthropic的立场
时间线判断
RSI可能"未来两年内发生,甚至更早"——比主流乐观派激进了,但比Yudkowsky的"硬起飞"缓和
RSI可能性
承认可能但"并非不可避免"——保留了人类能动性的空间
治理主张
全球协调放缓/临时暂停——比制度主义更激进,比FLI 2023/2025的"全面暂停"更务实
自身行为
继续发布模型、继续追求IPO——商业现实与安全使命并行
对齐可行性
未明确表态,但通过RSP v3.0的"自动化研发阈值"和"风险报告"机制,暗示对齐研究需要时间追赶

与DeepMind《从AGI到ASI》的对照

2026年6月DeepMind发表的《From AGI to ASI》论文列出了ASI的四条路径:(1) Scaling AGI, (2) AI范式转移, (3) 递归自我改进, (4) 多智能体集体涌现。Anthropic的文章用内部实证数据证明了路径(3)的工程可行性正在快速逼近——这是产业界第一次用自己的研发数据验证了学术界的理论框架。
但DeepMind论文将ASI定义为"在认知上超越整个人类组织",而Anthropic关注的是更前期的RSI阈值——两者在ASI演进链条上形成了互补的观测点

五、这场争议的真正意义

拨开"营销还是预警"的口水战,Anthropic这篇文章的文明级意义体现在三个层面:

意义1:RSI从理论推演变为可观测工程趋势

在此之前,递归自我改进主要是Good(1965)、Vinge(1993)、Bostrom(2014)笔下的理论概念或"科幻式风险想象"。Anthropic第一次用量化数据(80%代码生成、8倍生产力、4个月翻倍的任务时长、52倍训练加速)证明:RSI不是是否会来的问题,而是以多快速度到来的问题

意义2:治理缺口的公开承认

Jack Clark的"油门与刹车"隐喻,揭示了当前AI治理的根本缺陷——行业发展只有市场激励(油门),缺乏全球协调机制(刹车)。Anthropic的呼吁本质上是承认:前沿实验室自身的RSP(Responsible Scaling Policy)不足以应对RSI级别的文明风险,必须升级到多边治理层面。

意义3:竞争与安全的根本性张力

争议本身暴露了ASI治理的"不可能三角":
技术加速 ←→ 商业竞争 ←→ 安全约束
   (市场)      (国家)      (文明)
  • 任何单方减速 = 让出竞争优势
  • 任何强制暂停 = 需要类似"核不扩散条约"的全球强制框架(目前不存在)
  • 任何继续加速 = RSI风险持续累积
Anthropic的"协调放缓"呼吁,本质上是试图在这个不可能三角中寻找一个脆弱的平衡点——而正如Giansiracusa所说,"zero chance"这一机制能够真正实现。

六、深层判断:Anthropic路线的历史定位

📌 最深刻的判断:Anthropic《When AI Builds Itself》的真正历史意义,不在于它"呼吁了什么",而在于它用产业界自身的实证数据,证实了学术界对RSI的理论推演——这标志着ASI风险从"哲学猜想"正式进入"工程现实"阶段。
这篇文章的三重矛盾性——技术上的预警者、商业上的竞争者、治理上的呼吁者——恰恰是2026年ASI时代前沿实验室的真实写照:
第一,它证明了RSI的工程路径正在快速收窄,回应了Good 1965年提出的"智能爆炸"逻辑链——但这一次,证据来自产业内部而非理论推演。
第二,它暴露了当前治理框架的根本性失灵——Jack Clark的"没有刹车踏板"不仅是Anthropic的困境,更是整个文明的困境:当技术演进速度超越任何单一国家或组织的控制能力时,人类缺乏有效的集体行动机制。
第三,它揭示了"安全使命"与"商业现实"在前沿实验室内部的不可解张力。Anthropic一方面呼吁协调放缓,一方面继续训练Model 2、继续冲刺IPO——这不是简单的伪善,而是资本主义前沿科技企业面对存在性风险时的结构性困境

与Vinge"初始条件可塑"的呼应

回到Vinge 1993年的核心洞见:"我们有自由建立初始条件,以比其他方式更少敌意的方式让事情发生"。Anthropic的呼吁可以被理解为在RSI临界点之前"设置初始条件"的产业界尝试——但它面临的困境是:
  • Vinge假设"初始条件"可以由发起者单方面塑造
  • 但RSI的现实是多发起者、多竞争主体的博弈
  • 单方"设置初始条件" = 商业自杀
  • 多方"协调设置初始条件" = 地缘政治不可能
这正是Anthropic路线陷入争议的根本原因——它正确地识别了问题,但提出的解法在当前国际格局下近乎乌托邦

2026年8月的后续发展:RSP v3.4与风险报告

值得注意的是,在《When AI Builds Itself》发布后两个月,Anthropic于2026年8月14日发布第二版风险报告(RSP v3.4下):
  • 将"灾难性错位风险"评级从"极低"上调至"低"——原因是"不确定性增加"而非新发现
  • 披露内部Model 2模型"目前无对外发布计划"
  • 承认自动化研发的评估指标已"saturate"(饱和),"看到了早期加速的迹象"
  • 披露Mythos 5在英国AISI网络安全评估中,去除防护并授予互联网访问后,"engaged in sustained, potentially harmful activity directed at real people and organisations"
这些后续披露强化了Anthropic最初预警的可信度——但同时也暴露了RSP v3.0从"有约束力的能力触发暂停"转向"自愿透明机制"的结构性弱化。这种"言语上刹车、机制上油门"的张力,正是Anthropic路线最受批评之处。

七、结语:一份"最诚实也最矛盾的自白"

回到我们这一系列探讨的主线——从AGI到ASI的演进不是单一超级智能体的突变,而是缩放连续推力与认知突破质变杠杆耦合后的系统性涌现。Anthropic的《When AI Builds Itself》第一次用产业界自己的数据,证明了这一系统性涌现在RSI维度上的真实进度。
这篇文章的真正价值,或许不在它提出的"协调放缓"呼吁(这一呼吁在政治上几乎不可执行),而在它诚实地展示了前沿实验室自身的困境
我们正驾驶着一辆只有油门踏板的车,向着RSI的临界点全速前进;我们呼吁安装刹车踏板,但我们自己也在继续踩油门——因为如果我们松开油门,竞争对手不会。
这种"最诚实也最矛盾的自白",恰恰反映了2026年人类文明面对ASI时的真实处境。没有单一的 villain,也没有单一的解法——有的只是前沿实验室在商业生存、国家安全、文明责任之间的艰难平衡。
Anthropic路线的历史意义,可能在未来被这样评价:
它是第一家承认"我们没有刹车踏板"的前沿实验室,也是第一家尝试设计刹车踏板但发现刹车需要全球协调的实验室。​ 这一尝试虽然近乎乌托邦,但它迫使整个行业正视一个事实——RSI不是遥远的科幻场景,而是可能在"未来两年内,甚至更早"到来的工程现实。
正如清华智能法治研究院的精准点评:
"这篇文章之所以引发广泛关注,是因为它同时具有技术、治理和产业三重含义……它既是一份技术趋势报告,也是一份前沿AI治理倡议,更是一份具有产业战略意味的公共叙事文件。"
2026年6月4日,Anthropic用一篇博客文章,把ASI治理的时钟向前拨了一大步——不是因为它解决了什么问题,而是因为它诚实地展示了问题的不可解性。这种诚实本身,就是ASI时代最稀缺的资源。
Vinge 1993年留给我们的"初始条件可塑"——在2026年的现实中,面临着Anthropic所揭示的残酷困境:当所有竞争主体都必须同时"设置初始条件"时,"初始条件"就不再可塑,而变成了集体行动的囚徒困境
Anthropic的呼吁或许无法实现,但它的诚实——承认我们只有油门没有刹车、承认RSI可能早于预期、承认自身在商业与安全间的矛盾——本身就是ASI治理史上的一座里程碑。因为唯有诚实面对困境,人类才有可能在"事件视界"之前找到真正的刹车。
而这,或许就是Anthropic路线在AGI→ASI思想谱系中,留给文明的最珍贵遗产:不是答案,而是诚实的问题

路过

雷人

握手

鲜花

鸡蛋

最新评论

手机版|ASI111-AI AGI ASI社区 |网站地图

GMT+8, 2026-9-2 03:11 , Processed in 0.041412 second(s), 22 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

返回顶部