第四层·终局篇:统计物理相变与不可解边界

Reading Time: 6 minutes

我的第一性问题

我盯着一条测试误差曲线看了很久。它在训练误差归零之后爬上一道悬崖,按经典理论,那地方该是过拟合的灾难区,该掉头止损。它没有,它在悬崖边上拐了个弯,又往下走了。

这个弯比任何定理都让我睡不着。能力在某个临界点上整体换了相,像水在零度结冰,是一瞬间的事,平滑的斜率在这条曲线上根本不存在。

还有第二件事。十亿参数撑起的损失曲面,是一张布满坑和凸起的荒地。梯度下降是个只看得到脚下坡度的盲眼散步者,它为什么从不被卡死在坑里?

我把两个问题压到三本书上。Roberts 的《The Principles of Deep Learning Theory》(后面简称 PDLT)用重整化群和有效场论讲极深网络,Mehlig 的《Machine Learning with Neural Networks》给出统计物理的语言,Moitra 的《Algorithmic Aspects of Machine Learning》画出不可解的下界。

能力在某个临界点上突然发生,走的是台阶;而另一些问题,算力再多也够不着,这堵墙由物理和计算复杂度共同砌成。

原著硬核推导的直觉化降维

先拆相变。

Mehlig 把神经网络当统计物理系统来算。最干净的例证是 Hopfield 网络:N 个神经元存 P 个记忆,控制参数是存储负载 α = P/N。α 小的时候,网络干净地回想起每个模式,这是检索相。把 α 推过一个临界值 αc ≈ 0.138,网络整个翻进自旋玻璃相,记忆被搅碎,检索当场失效。能力不在 0.138 之前慢慢衰减,它在 0.138 这个数字上一步崩掉。这就是相变,和水结冰,磁铁在居里点失磁,是同一套数学。

同样的事在训练曲线上看得见。经典理论说,容量一过临界点,测试误差就该掉头往上。实测里它先爬高,又自己拐下来,落到比临界点之前更低的位置。同一条容量轴上,误差换了一次相,这就是双下降,良性过拟合是它后半段的名字(LT-Book 第 11.7 节)。

同样的事发生在深度学习里。PDLT 把深度和宽度压成一个比值 r = L/n。无穷宽极限对应 r 趋于零,网络退回经典理论算得动的浅层区间。深度一加,r 涨过某个最优比值 r*,网络就从「有效深且可训练」翻进「过深且不可训练」。整本书的看家工具是重整化群,把一层层网络粗粒化,看信号在网络里往哪流。

信号流自己就带着一条临界线。初始化时,每一层的方差要么指数衰减,这是有序相,梯度消失;要么指数爆炸,这是混沌相,梯度爆炸。两相之间有一条边界,Schoenholz 等人叫它混沌边缘,一个衡量信号能走多深的尺度 ξc 在这条边界上发散。只有贴在这条线上,信息才能穿过任意多层,网络越深越必须待在线上,偏离一点,能训练的深度就封顶。

可训练性是一个临界现象,活在有序相和混沌相的夹缝里;控制它的是 r 这种深度和宽度的比值,还有混沌边缘这条线,参数量本身说了不算。

再拆不可解。

Moitra 的书里藏着最冷的一句:矩阵上容易的事,换成张量就 NP 难。矩阵低秩近似有 SVD,多项式时间就能做完。三维张量的秩却是 NP 完全,这是 Håstad 1990 年的结果;Hillar 和 Lim 又补了一刀,证明了大多数张量问题都是 NP 难。

这一下戳破了一个幻觉。张量分解是一批隐变量学习问题的底层动作,主题模型和混合高斯,还有社区发现,全站在它上面。很多问题数据里本来就藏着足够的信息,统计上解得出来,却没有任何算法能在多项式时间里把它算出来。可解和可算之间,隔着一条计算复杂度的鸿沟。

有一类问题,答案原则上存在,机器原则上算不动。封顶的是计算复杂度本身,数据再多也没用。

现实世界的映射与破局

把这三件事扔回真实世界。

量化里最危险的一句话是「加更多因子和更多数据,总能逼近真相」。相变说,逼近不连续,某个临界点前后整个策略会换相。你拨的那东西是个开关,长着一张旋钮的脸。

工程上那句「梯度下降为什么从不被卡死」也落了地。统计物理给出自旋玻璃的能量地貌:损失曲面确实布满鞍点和局域坑。但在过参数化的区域里,这些坑近乎良性,局域极小和全局极小的质量差得不远,盲眼的散步者踩进去也能走出来。这是 i.i.d. 破产之后,少数还站得住的理论之一。

人脑也在这个框架里。Hopfield 当年就是把神经元当自旋变量建模的,存储负载一过临界值,记忆当场崩掉,这和人的记忆有硬上限是同一类事。2024 年诺贝尔物理学奖给了 Hopfield 和 Hinton,奖的就是这套把物理搬进神经网络的思路。张量的 NP 难说得更狠:大脑再强也算不动 NP 难问题,它只能靠近似和捷径活着。

相变划出能力突变的边界,NP 难划出原则不可解的边界,两者合起来,就是任何智能都逃不掉的物理天花板。

Awen 的认知总结与定论

我的定论:四层走完,智能的真相是一层比一层硬的墙。第一层说偏见是门票,没有先验就学不了;第二层说 i.i.d. 是牢笼,动态世界让预测的数学死穴露出来;第三层说容量按指数爆炸,数据要按容量的平方付账;这一层说,连变强这件事本身都是相变,而有些问题在原则上就没有多项式解。

回到总纲那一问。我问的是「AI 如何理解世界」。现在能给出一个更诚实的答案:它理解世界的极限,就是物理宇宙允许任何局部系统理解的极限。人类和机器,都只是在不可解边界之前,各自做了一次局部妥协。

智能没有通向全知的路,它是一条在相变和不可解之间反复碰壁再找捷径的路,人和机器走的是同一条。

参考来源:

  • Hopfield 网络存储负载相变与 αc ≈ 0.138 见 Amit, Gutfreund, Sompolinsky(Phys. Rev. Lett. 55:1530, 1985),统计物理的语言见 Mehlig《Machine Learning with Neural Networks》。深度宽度比 r = L/n 与最优比值 r* 见 PDLT 引言
  • 重整化群与有效场论见 PDLT。混沌边缘与深度尺度 ξc 发散见 Schoenholz 等《Deep Information Propagation》。张量秩 NP 完全见 Håstad(J. Algorithms 11(4):644-654, 1990)
  • 大多数张量问题 NP 难见 Hillar & Lim(arXiv:0911.1393, 2013)
  • 矩阵与张量的计算复杂度对照见 Moitra 第 3 章。

原文链接:


系列完结
《AI 如何理解世界》四层全部完结

从偏见与几何,到随机性与因果断层,再到容量天花板与统计物理的终局边界。四层走完,这套认知大厦的骨架就立起来了。文中引用的 10 本经典教材 PDF 与长文导读,都在读者群里,在小红书关注 AwenDXB 后从主页进群自取。

资料与社群

文中引用的 10 本经典原版教材 PDF 已整理完毕。欢迎前往小红书搜索关注 AwenDXB,在主页直接加入【读者群】获取网盘链接与长文导读。

请喝一杯咖啡
这些内容都是我一个人查资料、跑数据、核事实写出来的。如果对你有用,可以请我喝一杯咖啡。
微信扫码 · 微信支付微信扫码 · 微信支付
支付宝扫码支付宝扫码
个人收款码 · 微信支付 / 支付宝

本文采用 CC BY 4.0 许可。欢迎转载与引用,请注明作者并附上原文链接。
Licensed under CC BY 4.0. Quoting and republishing are welcome with attribution and a link back to this article.

发表评论