欢迎光临
我们一直在努力

AI 大模型的马尔萨斯陷阱

现在的 AI\\text{AI}AI 太费电了,不过想理解这意味着什么,还得先理解马尔萨斯的理论。

马尔萨斯的人口原理说的是农业社会人口增长对资源的稀释,但没预见到工业革命后利用新资源的可能。因此这理论需要修正,加入技术的规模效应,即 scaling law\\text{scaling law}scaling law

可将修正以纳入同一个框架,循环和突破本质是同一个系统里的两个解,差异只在于规模效应与资源约束谁先抵达临界点。

从最基础的生产开始建模。

总产出同时受两种相反力量支配,固定资源带来的劳动边际报酬递减,以及人口集聚带来的分工与知识溢出。用柯布-道格拉斯形式可以写成:

Y=A⋅Tα⋅N1−αY = A \\cdot T^\\alpha \\cdot N^{1-\\alpha}Y=ATαN1α

其中 YYY是总产出,TTT 是固定资源总量,NNN 是人口规模,α\\alphaα 是资源产出弹性,代表资源约束的强度,AAA 则是全要素生产率,代表技术与制度水平。这里的生产率 AAA 并非外生给定,人口越多,人际交互越频繁,知识传播与技术创新越快,生产率就越高,正是规模效应的体现:

A=A0⋅NβA = A_0 \\cdot N^{\\beta}A=A0Nβ

β\\betaβ 就是规模效应弹性,即人口每增长 1%1\\%1% 带来的生产率提升幅度。代入生产函数并除以人口规模,得到人均产出的表达式:

y=A⋅Tα⋅Nβ−αy = A \\cdot T^\\alpha \\cdot N^{\\beta-\\alpha}y=ATαNβα

β<α\\beta<\\alphaβ<α 时人口增长拉低收入,对应马尔萨斯陷阱,而 β>α\\beta>\\alphaβ>α 时人口增长推高收入,对应工业时代。

但如果 β\\betaβ 是常数,社会受初始状态决定,注定要么永远困在陷阱,要么永远增长,不存在转换的可能,这显然和历史不符。

β\\betaβ 并不是常数。它本质是一个社会的人际交互效率系数,人口密度越高,交通通信越发达,制度越鼓励分工与创新,人与人之间的正向溢出就越强,β\\betaβ 就越大,规模效应强度是人口与技术水平的二元函数 β=β(N,A)\\beta = \\beta(N,A)β=β(N,A),满足:

∂β∂N>0,∂β∂A>0\\dfrac{\\partial \\beta}{\\partial N} > 0 ,\\dfrac{\\partial \\beta}{\\partial A}>0Nβ>0,Aβ>0

人口扩张让人际交互的潜在连接数近似按平方级增长(如梅特卡夫定律),分工链条不断延伸,知识碰撞的概率持续上升,单位人口增长带来的生产率溢出会越来越强。

同时,技术与制度的效率增益,文字,印刷术,交通通信,专利制度等技术与制度进步,会大幅降低信息传播与协作的成本,让同等人口规模下的交互效率和创新产出显著提高。

这函数同时存在上下限,哪怕最原始的部落也有基础分工与经验传递,所以 β\\betaβ 有大于 000 的下限,受物理,认知成本与组织损耗限制,也不会无限放大。

除了生产,还需两个动态方程描述系统演化,其一沿用马尔萨斯的基本逻辑,人均收入高于生存底线时人口增长,低于时人口减少:

dNdt=r⋅N⋅(y−y0)\\dfrac{dN}{dt} = r \\cdot N \\cdot (y – y_0)dtdN=rN(yy0)

其中 rrr 是人口调整速度,y0y_0y0 是维持生存的人均收入底线。

其二是技术进步的动态,人口规模不仅直接通过交互提升生产率,还会加速知识积累与技术迭代,参与创新的人越多,知识溢出的速度就越快:

dAdt=δ⋅A⋅Nγ\\dfrac{dA}{dt} = \\delta \\cdot A \\cdot N^\\gammadtdA=δANγ

这里 δ\\deltaδ 是创新效率系数,γ\\gammaγ 是人口对创新的放大指数。

这系统存在两条不同的临界线,人口增长与技术进步的过程各沿其临界线竞速。

第一条是生存约束线,也就是马尔萨斯所说的资源约束,当人均收入刚好跌到生存底线时,人口停止增长,引发饥荒,瘟疫导致的人口负增长。把人均收入等于生存底线代入产出公式,就得到了生存约束的表达式:

A⋅Tα⋅Nβ(N,A)−α=y0A \\cdot T^\\alpha \\cdot N^{\\beta(N,A) – \\alpha} = y_0ATαNβ(N,A)α=y0

β<α\\beta<\\alphaβ<α 的农业社会,人口越多人均收入越低,这条线是人口增长的天花板,人口扩张到这个程度就会触发生存危机。

第二条是相变临界线,也就是马尔萨斯陷阱与工业革命的分界线。当规模效应强度刚好抵消土地的边际递减效应时,人均产出不再随人口规模变化,这就是经济形态发生质变的临界点:

β(N,A)=α\\beta(N,A)=\\alphaβ(N,A)=α

一旦越过这条线,人口增长对人均收入的作用就会彻底反转,从拉低收入变为推高收入,系统从负向循环切换到正向循环。

从农业社会的初始状态看,初始人口少,技术水平低,β<α\\beta<\\alphaβ<α,人均收入略高于生存线,人口缓慢增长。从该起点出发,人口增长一边通过土地资源稀释拉低人均收入,向生存约束线靠近,一边通过扩大交互网络推高 β\\betaβ,向相变临界线靠近,技术进步则一边直接提升人均收入,推远生存约束线,一边提升交互效率,加速 β\\betaβ 上升。

最终走向完全取决于哪条临界线先被触碰。

如果人口增长到生存约束线时,β\\betaβ 仍小于 α\\alphaα,系统就会进入马尔萨斯下一轮循环,人口达到峰值后因收入低于生存线开始下降,β\\betaβ 随之回落,人均产出则随人口减少回升,待收入回到生存线以上,人口再次增长,循环往复。

技术在循环中缓慢积累,让生存约束线右移,均衡人口峰值逐渐提高,但只要 β\\betaβ 没超过 α\\alphaα,社会就摆脱不了增长,过剩危机,衰落,复苏的负反馈,长期停留在生存线附近。

如果 β\\betaβ 上升到等于 α\\alphaα 时,人均收入仍然高于底线,系统就会跨过相变点,进入全新的轨道。越过临界线后,人口增长不再是负担,反而因为规模效应增强持续推高人均产出,进一步支撑人口增长和技术进步,反过来更快提升 β\\betaβ,由此形成正反馈循环,挣脱资源的束缚,这就是工业革命的本质。

把两条临界线联立,就解出系统演化的鞍点分界。联立两个临界方程后,在交点处 β\\betaβ 恰等于 α\\alphaα,因此人均产出公式里人口项的指数刚好为 000,可直接解出临界状态下的技术水平:

A∗=y0TαA^*=\\dfrac{y_0}{T^\\alpha}A=Tαy0

这意味着,当技术水平积累到该临界时,如果此时对应的人口规模效应能够达到 α\\alphaα,系统就会突破马尔萨斯陷阱,如果此时 β\\betaβ 仍小于 α\\alphaα,人口继续增长就会先触碰生存约束,落入循环。

换句话说,工业革命爆发的核心前提,就是在技术水平刚好能支撑生存的规模下,人口的交互溢出效应足以抵消资源的边际递减。

这也解释了为什么工业革命偏偏发生在欧洲,而不是其他人口同样众多的古代文明。

在农业经验技术体系下,β\\betaβ 提升非常慢,往往赶不上人口增长带来的资源收入稀释,大多数文明总是先撞上生存线,在周期性治乱循环里原地踏步。而欧洲得益于科学革命,地理大发现等一系列外生冲击的叠加,大幅提升了人际交互与创新的效率,更偶然的,英国发现了大量的煤矿,β\\betaβ 迅速越过了 α\\alphaα 临界线,抢在生存约束触发前完成相变。

因此,马尔萨斯理论只是准确描述了 β<α\\beta<\\alphaβ<α 的农业社会常态,补上规模法则刻画的现代逻辑,就是真实的人类文明演化史。

现在用同样的逻辑看 AI\\text{AI}AI 的发展,虽然发展很快,但风险在于能耗临界点的触及。

按单位功耗的等效运算能力衡量,人脑能效比当前最先进的 GPU\\text{GPU}GPU 高数十万倍,本质是底层计算范式的差异,人脑以存算一体的突触脉冲完成计算,能耗集中在计算本身,而冯·诺依曼架构下,数据搬运消耗了七成以上功耗,真正用于计算的能量占比极低。

scaling law\\text{scaling law}scaling law 下,这种能效劣势还会随规模进一步放大。AI\\text{AI}AI 性能随模型规模,算力呈幂律提升,但能效却随规模扩张边际递减:

  • Transformer\\text{Transformer}Transformer 的注意力计算,内存访问开销本身呈超线性增长,算力扩张带来的通信,数据搬运成本的增速,远超计算单元本身的效率提升;
  • 硬件制程的能效增益持续收窄,性能与能效的剪刀差不断扩大;

这本质上就是 AI\\text{AI}AI 版的马尔萨斯赛跑,和人口模型完全同构:

  • 算力规模对应人口,单位能效对应人均产出;
  • α\\alphaα 代表固有架构的能效递减系数,规模越大,协调与搬运的额外损耗越高,对应资源边际递减;
  • β\\betaβ 代表规模与技术带来的能效提升系数,对应规模效应;

β\\betaβ 是算力规模 NNN 和技术水平 AAA 的增函数:

∂β∂N>0,∂β∂A>0\\dfrac{\\partial \\beta}{\\partial N} > 0,\\quad \\dfrac{\\partial \\beta}{\\partial A}>0Nβ>0,Aβ>0

系统同样存在两条临界线,一条是能耗约束线,当总能耗突破成本或电力供给天花板,算力扩张被迫停滞,对应马尔萨斯的生存底线,另一条是相变临界线,当 β=α\\beta=\\alphaβ=α 时达到突破临界点,越过之后算力扩张反而会推高单位能效。

当前我们正处在 β<α\\beta<\\alphaβ<α 的能效马尔萨斯陷阱阶段,现有架构下,能效提升赶不上算力扩张的能耗增长,总能耗快速攀升。

沿当前路径走下去,系统会先触碰能耗约束,陷入算力扩张,能耗飙升,扩张停滞的循环。换句话说,现在的 AI\\text{AI}AI 太费电了,还没到奇点,电力就耗尽了,为抵抗如此,token\\text{token}token 越来越贵是一个典型负反馈。

突破循环的关键是底层计算范式改变,如同工业革命一次性抬升 β\\betaβ 值,存算一体等方向可消除了数据搬运的巨量能耗,这类技术一旦规模化成熟,将推动 β\\betaβ 越过 α\\alphaα 临界点,系统进入规模越大,能效越高的正反馈循环,完成 AI\\text{AI}AI 领域的革命。

不是所有文明都会爆发工业革命,像中南美洲文明甚至在前现代就由于触及资源天花板而自行消亡了,认识到这个很重要。

值得注意的是,克莱伯定律描述的多维度指数不均衡发展是限制的本质,总会碰到天花板,若不改变维度本身的范式,极限便无法突破,但若获得了突破,就会进入另一个马尔萨斯循环,然后再次寻求突破。如此反复,直到经理到来。

浙江温州皮鞋湿,下雨进水不会胖。

赞(0)
未经允许不得转载:171主机测评 » AI 大模型的马尔萨斯陷阱
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址