找回密码
 立即注册
搜索
热搜: AI AGI ASI
ASI111-AI AGI ASI社区 门户 首页 AI理学 查看内容

ASI与AGI的缩放定律:算力、数据与智能的幂律关系

2026-9-1 21:32| 发布者: Linzici| 查看: 1| 评论: 0

摘要: "Scaling Law"被业界说得太像一句咒语了——仿佛只要算力、数据、参数继续涨,ASI就会自动到来。但DeepMind 2026年《From AGI to ASI》报告给出的判断要冷静得多:Scaling Law是经验律,不是物理定律;它能预测损失 ...
ASI与AGI的缩放定律:算力、数据与智能的幂律关系
 
"Scaling Law"被业界说得太像一句咒语了——仿佛只要算力、数据、参数继续涨,ASI就会自动到来。但DeepMind 2026年《From AGI to ASI》报告给出的判断要冷静得多:Scaling Law是经验律,不是物理定律;它能预测损失下降,却不能保证新能力按同比例涌现。从AGI到ASI的真正跃迁,不是单一幂律的自然延伸,而是"有效计算缩放"与"范式跃迁、递归自我改进、多智能体群体"四条路径的耦合。下面拆解这个被误读最多的命题。

一、Scaling Law的本来面目:幂律描述的是"损失",不是"能力"

OpenAI 2020年Kaplan等人的原始发现是:语言模型的交叉熵损失L与模型参数量N、训练数据D、计算量C之间呈幂律关系:
  • (参数缩放)
  • (数据缩放)
  • (计算缩放)
2022年DeepMind的Chinchilla论文修正了Kaplan的结论:在固定计算预算下,模型参数与训练数据应同步增长(约20 tokens/参数),而非Kaplan主张的"重参数、轻数据"。
但这里有个被忽视的关键:
💡 缩放律预测的是损失(loss)——即模型对下一个token的"惊讶度",而损失不等于任何人所关心的真实能力。没人会因为cross-entropy是1.97就买一个模型。
幂律指数极小意味着边际收益急剧衰减:计算量每增加10倍,损失大约只下降5%-11%,剩余的错误需要再付出10倍算力才能攻掉三分之一。这就是" bitter lesson"的残酷一面——缩放确实有效,但有效得很昂贵。

二、从AGI到ASI:有效计算的三大乘性因子

DeepMind报告提出"有效计算"(effective compute)框架,它由三个独立改善的因子相乘而成:
因子
年增速
性质
硬件制造进步
~1.5×
最确定
计算投资增长
~2.5×
较确定
算法效率提升
3-6×
不确定
三者相乘得到有效计算约10×/年的增长率。这个增速如果维持:
  • 1年后可运行AGI实例:1,000 → 10,000
  • 5年后:1,000 → 1亿
  • 或100万实例以100倍速度运行
核心洞察:即使单体AGI模型的能力完全停滞,仅凭"运行更多实例、跑得更快、'思考'更久",聚合智能也可能达到ASI门槛。这就是"单纯定量缩放引发定性飞跃"的机制——1亿个人类水平的AI协作本身,就是一种超级智能
但报告同时警告:能力增长与有效计算增长之间可能存在三种 regime
  1. 递减回归:需要指数级计算增长才能换取线性能力增长 → 进展缓慢
  2. 成比例:能力与计算同步指数增长 → 指数进展
  3. 递归自我改进:AI加速AI研究 → 超指数(双曲线)增长​ → 奇点
哪种regime会主导,目前无法确定。

三、数据墙:预训练缩放律的第一道硬约束

缩放律的第一个裂缝出现在数据侧。高质量人类文本数据预计在本十年内耗尽,这导致:
自然数据缩放律的失效:当训练数据逼近"数据墙"(约10¹⁴ tokens高质量人类文本)时,继续增加参数和算力不再按比例提升性能。
合成数据的修正缩放律:微软亚洲研究院SYNTHLLM框架首次实证验证——合成数据遵循修正的规模法则(rectified scaling law)
  • 合成数据在各种模型规模下都可靠遵循幂律关系
  • 性能提升在约3000亿token处趋近平稳
  • 较大模型用较少token就能接近最佳性能(8B模型在1T token达峰值,3B模型需4T token)
另一项千模型大规模研究进一步发现:
  • 30%合成 + 70%自然是最优混合比
  • 纯合成数据会出现"条件模型坍塌"
  • 用更大模型生成数据不一定带来更好训练效果(8B生成器有时优于70B生成器)
⚠️ 这意味着:合成数据能延长缩放律的寿命,但不能无限延续。修正缩放律本身就有"知识天花板"——它受限于参考文档和教师模型的知识边界。

四、推理时计算:Scaling Law的第二条曲线

当预训练缩放趋缓,业界把算力分配重心转移到推理时计算(test-time compute)。其核心公式是:
其中N是采样次数/思考轮数,是模型训练决定的理论上限。随着N增加,性能趋近,但边际收益呈指数衰减
关键实证:2025年德克萨斯奥斯汀大学等机构在世界基础模型(WFM)上的SWIFT框架证明:
  • 世界模型同样存在test-time scaling law
  • 小模型 + 测试时搜索在相同推断计算预算下可匹配或超越大模型
  • 通过Top-K剪枝和beam search,测试时搜索效率可大幅提升
这揭示了一个深刻转向:
📌 从"训练时把所有智能灌进参数"转向"推理时通过搜索、规划、验证动态分配计算"——这是Scaling Law从"静态幂律"转向"动态计算分配"的范式跃迁。
黄仁勋将其提炼为"三条Scaling Law":预训练缩放、后训练缩放、推理时缩放。当前前沿实验室的算力分配重心,正从第一条曲线转移到后两条。

五、从幂律到ASI:为什么单纯缩放不够

即便有效计算维持10×/年增长,从AGI到ASI仍有三道缩放律跨不过的墙

墙1:抽象壁垒(Abstract Barrier)

DeepMind报告提出的猜想:如果AI主要从人类已有知识中学习,它可能擅长重组概念,但缺乏从原始数据中自主提炼全新概念原语的机制。一个只基于前牛顿时代知识训练的现代大模型,几乎不可能自行推导出广义相对论——而这是ASI应具备的能力。

墙2:暴力搜索的NP-hard天花板

在开放式科学发现或NP-hard级优化问题中,暴力搜索的算力需求会迅速耗尽宇宙资源。国际象棋和围棋中暴力搜索有效,但真实世界的组合爆炸远超任何可预见的计算预算。

墙3:物理法则的硬约束

ASI严格受限于:
  • 光速:限制分布式节点协调的信息传播上限
  • 兰道尔原理:设定逻辑运算与信息擦除的最低能耗
  • Bekenstein界限:锁定有限空间与能量下的最大信息量
  • 实时约束:面对非平稳复杂系统(生物、气候、经济),ASI也只能受物理时间限制进行观测
这意味着:工程ASI不是"逼近AIXI的理论极限",而是"在物理约束下构造一个尽可能接近AIXI的资源受限近似"

六、ASI的真正驱动力:四条路径的耦合

DeepMind报告明确:从AGI到ASI有四条平行、非互斥、可能相互催化的路径:
路径1: 有效计算缩放(~10×/年)
   ↓ 提供燃料
路径2: 算法范式跃迁(世界模型/无限上下文/持续学习/神经形态)
   ↓ 提供认知基座
路径3: 递归自我改进(RSI)
   ↓ 提供加速器
路径4: 多智能体群体智能
   ↓ 提供最终形态
关键依存关系
  1. 缩放律为其他三条路径提供物理基础——没有有效计算的年10倍增长,世界模型训练不起、RSI跑不动、1亿实例部署不了
  2. 世界模型打破抽象壁垒——通过跨模态因果推理,让AI从"关联建模"升维至"反事实建模"
  3. RSI在缩放律提供的算力基础上触发超指数增长——AI加速AI研究,形成双曲线增长的正反馈
  4. 多智能体群体是缩放律的最终载体——1亿AGI实例通过"认知互联网"协议高带宽协作
💡 单独任何一条路径都到不了ASI。单纯缩放会遇到数据墙和收益递减;单纯范式跃迁不可预测且可能耗时极长;单纯RSI会因奖励黑客而失稳;单纯多智能体缺乏语义协作基础。只有四者耦合,才可能系统性地涌现ASI。

七、结论:幂律是地图,不是领土

回到用户问题的核心——"算力、数据、智能的幂律关系":
✅ Scaling Law是真实的,但是经验律而非物理定律。​ 它准确地描述了过去十年LLM损失随参数/数据/计算的幂律下降,且在合成数据和测试时计算场景下仍然成立(尽管是修正版本)。
❌ 但Scaling Law不能保证ASI自动到来。​ 三个根本限制:
  1. 数据墙:高质量自然数据枯竭,合成数据有300B token的效益天花板
  2. 收益递减:计算量10×增长仅换来损失下降5%-11%,要halve损失需1000×计算
  3. 能力≠损失:损失下降不按比例转化为新能力涌现
🔑 真正的AGI→ASI跃迁需要
  • 有效计算持续10×/年增长(提供燃料)
  • 算法范式跃迁突破抽象壁垒(提供认知基座)
  • 递归自我改进触发超指数动态(提供加速器)
  • 多智能体群体智能实现集体超级智能(提供最终形态)
  • 同时受物理法则、数据墙、能源约束、对齐治理四重刹车
正如DeepMind报告所总结的:"单纯的定量缩放可以解锁看似需要定性飞跃的能力和应用程序,使得在两者之间划清界限变得复杂"。这意味着ASI可能不是某个戏剧性的"奇点时刻",而是有效计算缩放、范式跃迁、RSI、多智能体协作四条路径耦合后的系统性涌现——它会在5-15年的时间尺度上渐进而确定地到来,而非某个单体模型突然觉醒。
📌 对治理的含义是深远的:如果我们误以为"继续堆算力就能到ASI",就会严重低估范式跃迁的不确定性、RSI的失控风险、多智能体对齐的复合难度。真正的ASI安全,必须从Scaling Law还在生效的今天就开始植入——因为当幂律曲线开始陡升时,人类将没有时间反应
Scaling Law告诉我们智能能涨多快,但没告诉我们涨向何方。从AGI到ASI的航程,幂律是风帆,而非罗盘;是地图,而非领土。

路过

雷人

握手

鲜花

鸡蛋

最新评论

手机版|ASI111-AI AGI ASI社区 |网站地图

GMT+8, 2026-9-2 03:11 , Processed in 0.037168 second(s), 22 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

返回顶部