第三层·天花板篇:容量爆炸与非欧流形

Reading Time: 7 minutes

我的第一性问题

我一直算一笔账。参数翻十倍,训练损失肉眼可见地降;数据再翻十倍,曲线平了。加层,再平。

真正让我卡住的是另一件事。同一批样本,同一个参数量,我把输入从坐标轴换成邻居列表,模型忽然学会了那件事。公式没变,预算没变,只换了数据所待的空间。

于是我的问题收敛成一句:暴力堆叠的天花板在哪里,谁在划线?

我把这个问题压回两本教材上。张潼的《Mathematical Analysis of Machine Learning Algorithms》(后面简称 LT-Book)负责算容量这条线。Ma 和 Tang 的《Deep Learning on Graphs》(简称 DLG)负责回答另一半:数据到底长在什么形状上。

在 总纲 里我把第三层写成一句话,算力和数据有极限,但正确的几何结构没有。这一篇是把它算出来。

天花板由两个量共同决定:模型能装下多少函数,以及数据活在一个什么形状的空间里。

原著硬核推导的直觉化降维

先算容量。

LT-Book 第 6 章给 Rademacher 复杂度一个极好懂的写法(Definition 6.3)。你把训练集上的每个样本配一枚随机硬币 σi,取值 +1 或 -1,然后问一个问题:我的函数类里,有没有哪个函数能把这堆纯噪声的符号也拟合得七七八八?

R(G, Sn) = Eσ supw (1/n) Σ σi φ(w, Zi)

能拟合噪声的程度就是容量的度量。拟合得好,只能说明这个函数类太灵活。

Theorem 6.4 给出 εn(G, D) ≤ 2Rn(G, D),泛化误差被容量两倍压住。Corollary 6.19 把它变成一条能直接用的不等式:真实风险 ≤ 训练风险 + 2Rn(G, D) + M√(ln(1/δ)/2n)。最后一项随样本量衰减,前一项由容量说了算。

Example 6.5 算了一个 VC 类,容量维度 d,样本量 n,得到 R ≤ √(2d ln(en/d)/n)。想把容量项压小,样本量得跟着 d 一起涨。堆数据有用,账单按容量开。

真正的天花板出现在深度上。Theorem 11.26 给 K 层网络的 Rademacher 复杂度一个上界:R(F(k), Sn) ≤ A · M · 32√(d+1)/√n,其中 A = 2k-2 ∏ℓ=2k Aℓ。

盯住 A 看。它是每一层 L1 正则化参数的连乘积,前面还挂着一个 2 的深度次方。每加一层,A 就多乘上一个 2 和那一层自己的因子。容量以 A/√n 的形状进入误差界,要把复杂度压回原来的水平,样本量得按 A 的平方增长,A 涨十倍,数据要涨一百倍。

深度红利和数据账单绑在一起,账单涨得比线性快。

容量在深度上按指数爆炸,数据要按容量的平方付账,这是暴力堆叠的算术底线。

再算几何。

LT-Book 的整套界都假设数据点落在欧氏空间里,用内积和范数算距离。DLG 第 2 章给出另一套坐标系:谱图理论里,图傅里叶变换用拉普拉斯矩阵的特征向量当基(式 2.11),特征值代表频率,小的那批对应在图上游走时变化缓慢的分量。第 5 章把卷积搬到图上,谱域滤波和空域滤波两套做法都给了。

这里藏着一个更普遍的事实。真实高维数据的有效维度远低于名义维度,数据蜷在一个嵌进高维空间的低维流形上,而这个流形本身是弯的。Fefferman 等人在《Testing the Manifold Hypothesis》里把这个假设做成了可检验的对象。曲率一旦不为零,欧氏距离就开始骗人。Aggarwal 等人在 ICDT 2001 证明,L2 距离下最近邻与最远邻的相对对比度随维度按 1/√d 衰减,邻近这个概念本身会失去意义。层级数据更极端,Poincaré embeddings 把树状的层级结构嵌进负曲率双曲空间,比零曲率的欧氏空间省得多。

真实数据的有效维度低于名义维度,欧氏距离套在上面会失真;维度灾难的根源,是几何用错了坐标系。

对称性是几何的另一半。一张图的节点没有天然顺序,你重排邻接矩阵,图的语义不变。这个对称性构成的群是置换群,图上的网络据此设计成置换等变的消息传递,推导在 Bronstein 等人的 Geometric Deep Learning 里写得很完整。

真实数据不住在欧氏空间里,它住在带曲率的流形和图结构上;把对称性写进模型,等于先把搜索空间砍掉一大截。

现实世界的映射与破局

回头看那笔账,很多现象就顺了。

量化里用因子暴露向量算距离,是在欧氏空间里做最近邻。高维下这种距离失去对比度,看起来相似的资产,在数学上可能和无差的点差不多远。Aggarwal 那 1/√d 说的就是这件事。

架构选择上也有对应。Transformer 把每个 token 和所有 token 连起来,注意力机制正是在一张完全图上做置换等变的消息传递,几何从格点换成了全域图,长程依赖因此不必再靠一层层传递。Geometric Deep Learning 的整个主张,就是把 Transformer 和 GNN 都从置换对称性里推出来。

工程上更直观。做量化或者做蒸馏,调学习率或者加层,动的都是同一个流形上的参数坐标,天花板没变。真正带来跃迁的动作,是把数据换进正确的几何:图像当格点用卷积,分子当图用消息传递,层级知识用双曲空间。

人脑也走这条捷径。猫的初级视皮层里有一批神经元只对特定方向的线条有反应,而这种朝向选择性在从没见过东西的幼猫身上就已经存在,说明它来自先天结构,不是被视觉经验教出来的(Hubel & Wiesel 1962 / 1963)。平移也一样,物体在视野里挪了位置,人还能认出是同一个东西,位置的变化被自动过滤掉了。这些先验就是对称性,它们在模型里的对应物就是等变层。

绕开维度灾难的路子,是把数据真实的对称性写成模型结构;算力只负责把这条路走完。

Awen 的认知总结与定论

我的定论:容量划出硬边界,几何决定这条边界画在哪个坐标系里。第一层里偏见是门票,第二层里 i.i.d. 是牢笼,到这一层,暴力堆叠终于变成了看得见的算术,数据要按容量的平方付账。同一件事在三个层上换了名字:偏见是学习的门票,对称性是押对方向的偏见,押错了门票就翻成第二层那把绞索。

可这里还剩一个没被解释的东西。既然容量有硬边界,为什么把参数堆到远超样本量,网络还能泛化?训练损失已经降到零,测试误差却还在往下走。LT-Book 第 11.7 节把这个矛盾直接摆在标题里:Double Descent and Benign Overfitting。曲线在经典理论预测的悬崖边上,又往前迈了一段。

那一段路,经典容量理论解释不了。更冷的问题是,一个非凸的损失曲面,凭什么梯度下降总能找到一个能用的解?

第四层要拆的就是这些。教材是三本,Roberts 的《The Principles of Deep Learning Theory》用重整化群和有效场论讲极深网络,Mehlig 的《Machine Learning with Neural Networks》提供统计物理的语言,Moitra 的《Algorithmic Aspects of Machine Learning》画出不可解的下界。到那里,划线的力量换成了相变和计算复杂度本身。

参考来源:

  • Rademacher 复杂度定义见 LT-Book Definition 6.3
  • 泛化误差与容量关系见 Theorem 6.4
  • 带置信度的界见 Corollary 6.19
  • VC 类容量估计见 Example 6.5
  • 有限函数类估计见 Theorem 6.23
  • K 层网络容量上界见 Theorem 11.26
  • 双下降与良性过拟合见 LT-Book 第 11.7 节。谱图理论与图傅里叶变换见 DLG 第 2 章(2.4 节的谱图理论,2.5.1 节的图傅里叶变换,式 2.11)
  • 图上的滤波器与图神经网络见 DLG 第 5 章(5.2 节的总框架,5.3 节的图上滤波器)。流形假设的可检验性见 Fefferman, Mitter, Narayanan, Testing the Manifold Hypothesis, JAMS 29(4), 2016, pp. 983-1049。高维距离对比度衰减见 Aggarwal, Hinneburg, Keim, ICDT 2001, pp. 420-434。双曲空间嵌入层级结构见 Nickel, Kiela, Poincaré Embeddings for Learning Hierarchical Representations, NeurIPS 2017。置换对称性与架构推导见 Bronstein et al., Geometric Deep Learning, arXiv:2104.13478。

原文链接:


下篇预告

容量有硬边界,能不能绕开?下一篇拆相变:Hopfield 网络在 α_c≈0.138 一步崩进自旋玻璃相,深度网络的初始化也活在有序相与混沌相的夹缝里。最后落到不可解的那条线:张量秩是 NP 完全的,有一类问题,答案原则上存在,机器原则上算不动。

资料与社群

文中引用的 10 本经典原版教材 PDF 已整理完毕。欢迎前往小红书搜索关注 AwenDXB,在主页直接加入【读者群】获取网盘链接与长文导读。

请喝一杯咖啡
这些内容都是我一个人查资料、跑数据、核事实写出来的。如果对你有用,可以请我喝一杯咖啡。
微信扫码 · 微信支付微信扫码 · 微信支付
支付宝扫码支付宝扫码
个人收款码 · 微信支付 / 支付宝

本文采用 CC BY 4.0 许可。欢迎转载与引用,请注明作者并附上原文链接。
Licensed under CC BY 4.0. Quoting and republishing are welcome with attribution and a link back to this article.

发表评论