ASI与AGI的缩放定律:算力、数据与智能的幂律关系
"Scaling Law"被业界说得太像一句咒语了——仿佛只要算力、数据、参数继续涨,ASI就会自动到来。但DeepMind 2026年《From AGI to ASI》报告给出的判断要冷静得多:Scaling Law是经验律,不是物理定律;它能预测损失下降,却不能保证新能力按同比例涌现。从AGI到ASI的真正跃迁,不是单一幂律的自然延伸,而是"有效计算缩放"与"范式跃迁、递归自我改进、多智能体群体"四条路径的耦合。下面拆解这个被误读最多的命题。
一、Scaling Law的本来面目:幂律描述的是"损失",不是"能力"OpenAI 2020年Kaplan等人的原始发现是:语言模型的交叉熵损失L与模型参数量N、训练数据D、计算量C之间呈幂律关系:
2022年DeepMind的Chinchilla论文修正了Kaplan的结论:在固定计算预算下,模型参数与训练数据应同步增长(约20 tokens/参数),而非Kaplan主张的"重参数、轻数据"。
但这里有个被忽视的关键:
幂律指数极小意味着边际收益急剧衰减:计算量每增加10倍,损失大约只下降5%-11%,剩余的错误需要再付出10倍算力才能攻掉三分之一。这就是" bitter lesson"的残酷一面——缩放确实有效,但有效得很昂贵。
二、从AGI到ASI:有效计算的三大乘性因子DeepMind报告提出"有效计算"(effective compute)框架,它由三个独立改善的因子相乘而成:
三者相乘得到有效计算约10×/年的增长率。这个增速如果维持:
核心洞察:即使单体AGI模型的能力完全停滞,仅凭"运行更多实例、跑得更快、'思考'更久",聚合智能也可能达到ASI门槛。这就是"单纯定量缩放引发定性飞跃"的机制——1亿个人类水平的AI协作本身,就是一种超级智能。
但报告同时警告:能力增长与有效计算增长之间可能存在三种 regime:
哪种regime会主导,目前无法确定。
三、数据墙:预训练缩放律的第一道硬约束缩放律的第一个裂缝出现在数据侧。高质量人类文本数据预计在本十年内耗尽,这导致:
自然数据缩放律的失效:当训练数据逼近"数据墙"(约10¹⁴ tokens高质量人类文本)时,继续增加参数和算力不再按比例提升性能。
合成数据的修正缩放律:微软亚洲研究院SYNTHLLM框架首次实证验证——合成数据遵循修正的规模法则(rectified scaling law):
另一项千模型大规模研究进一步发现:
四、推理时计算:Scaling Law的第二条曲线当预训练缩放趋缓,业界把算力分配重心转移到推理时计算(test-time compute)。其核心公式是:
其中N是采样次数/思考轮数,是模型训练决定的理论上限。随着N增加,性能趋近,但边际收益呈指数衰减。
关键实证:2025年德克萨斯奥斯汀大学等机构在世界基础模型(WFM)上的SWIFT框架证明:
这揭示了一个深刻转向:
黄仁勋将其提炼为"三条Scaling Law":预训练缩放、后训练缩放、推理时缩放。当前前沿实验室的算力分配重心,正从第一条曲线转移到后两条。
五、从幂律到ASI:为什么单纯缩放不够即便有效计算维持10×/年增长,从AGI到ASI仍有三道缩放律跨不过的墙:
墙1:抽象壁垒(Abstract Barrier)DeepMind报告提出的猜想:如果AI主要从人类已有知识中学习,它可能擅长重组概念,但缺乏从原始数据中自主提炼全新概念原语的机制。一个只基于前牛顿时代知识训练的现代大模型,几乎不可能自行推导出广义相对论——而这是ASI应具备的能力。
墙2:暴力搜索的NP-hard天花板在开放式科学发现或NP-hard级优化问题中,暴力搜索的算力需求会迅速耗尽宇宙资源。国际象棋和围棋中暴力搜索有效,但真实世界的组合爆炸远超任何可预见的计算预算。
墙3:物理法则的硬约束ASI严格受限于:
这意味着:工程ASI不是"逼近AIXI的理论极限",而是"在物理约束下构造一个尽可能接近AIXI的资源受限近似"。
六、ASI的真正驱动力:四条路径的耦合DeepMind报告明确:从AGI到ASI有四条平行、非互斥、可能相互催化的路径:
关键依存关系:
七、结论:幂律是地图,不是领土回到用户问题的核心——"算力、数据、智能的幂律关系":
✅ Scaling Law是真实的,但是经验律而非物理定律。 它准确地描述了过去十年LLM损失随参数/数据/计算的幂律下降,且在合成数据和测试时计算场景下仍然成立(尽管是修正版本)。
❌ 但Scaling Law不能保证ASI自动到来。 三个根本限制:
🔑 真正的AGI→ASI跃迁需要:
正如DeepMind报告所总结的:"单纯的定量缩放可以解锁看似需要定性飞跃的能力和应用程序,使得在两者之间划清界限变得复杂"。这意味着ASI可能不是某个戏剧性的"奇点时刻",而是有效计算缩放、范式跃迁、RSI、多智能体协作四条路径耦合后的系统性涌现——它会在5-15年的时间尺度上渐进而确定地到来,而非某个单体模型突然觉醒。
Scaling Law告诉我们智能能涨多快,但没告诉我们涨向何方。从AGI到ASI的航程,幂律是风帆,而非罗盘;是地图,而非领土。
|
GMT+8, 2026-9-2 03:11 , Processed in 0.037168 second(s), 22 queries .
Powered by Discuz! X3.5
© 2001-2026 Discuz! Team.