我的第一性问题
我一直算一笔账。参数翻十倍,训练损失肉眼可见地降;数据再翻十倍,曲线平了。加层,再平。
真正让我卡住的是另一件事。同一批样本,同一个参数量,我把输入从坐标轴换成邻居列表,模型忽然学会了那件事。公式没变,预算没变,只换了数据所待的空间。
于是我的问题收敛成一句:暴力堆叠的天花板在哪里,谁在划线?
我把这个问题压回两本教材上。张潼的《Mathematical Analysis of Machine Learning Algorithms》(后面简称 LT-Book)负责算容量这条线。Ma 和 Tang 的《Deep Learning on Graphs》(简称 DLG)负责回答另一半:数据到底长在什么形状上。
在 总纲 里我把第三层写成一句话,算力和数据有极限,但正确的几何结构没有。这一篇是把它算出来。
天花板由两个量共同决定:模型能装下多少函数,以及数据活在一个什么形状的空间里。
原著硬核推导的直觉化降维
先算容量。
LT-Book 第 6 章给 Rademacher 复杂度一个极好懂的写法(Definition 6.3)。你把训练集上的每个样本配一枚随机硬币 σi,取值 +1 或 -1,然后问一个问题:我的函数类里,有没有哪个函数能把这堆纯噪声的符号也拟合得七七八八?
R(G, Sn) = Eσ supw (1/n) Σ σi φ(w, Zi)
能拟合噪声的程度就是容量的度量。拟合得好,只能说明这个函数类太灵活。
Theorem 6.4 给出 εn(G, D) ≤ 2Rn(G, D),泛化误差被容量两倍压住。Corollary 6.19 把它变成一条能直接用的不等式:真实风险 ≤ 训练风险 + 2Rn(G, D) + M√(ln(1/δ)/2n)。最后一项随样本量衰减,前一项由容量说了算。
Example 6.5 算了一个 VC 类,容量维度 d,样本量 n,得到 R ≤ √(2d ln(en/d)/n)。想把容量项压小,样本量得跟着 d 一起涨。堆数据有用,账单按容量开。
真正的天花板出现在深度上。Theorem 11.26 给 K 层网络的 Rademacher 复杂度一个上界:R(F(k), Sn) ≤ A · M · 32√(d+1)/√n,其中 A = 2k-2 ∏ℓ=2k Aℓ。
盯住 A 看。它是每一层 L1 正则化参数的连乘积,前面还挂着一个 2 的深度次方。每加一层,A 就多乘上一个 2 和那一层自己的因子。容量以 A/√n 的形状进入误差界,要把复杂度压回原来的水平,样本量得按 A 的平方增长,A 涨十倍,数据要涨一百倍。
深度红利和数据账单绑在一起,账单涨得比线性快。
容量在深度上按指数爆炸,数据要按容量的平方付账,这是暴力堆叠的算术底线。
再算几何。
LT-Book 的整套界都假设数据点落在欧氏空间里,用内积和范数算距离。DLG 第 2 章给出另一套坐标系:谱图理论里,图傅里叶变换用拉普拉斯矩阵的特征向量当基(式 2.11),特征值代表频率,小的那批对应在图上游走时变化缓慢的分量。第 5 章把卷积搬到图上,谱域滤波和空域滤波两套做法都给了。
这里藏着一个更普遍的事实。真实高维数据的有效维度远低于名义维度,数据蜷在一个嵌进高维空间的低维流形上,而这个流形本身是弯的。Fefferman 等人在《Testing the Manifold Hypothesis》里把这个假设做成了可检验的对象。曲率一旦不为零,欧氏距离就开始骗人。Aggarwal 等人在 ICDT 2001 证明,L2 距离下最近邻与最远邻的相对对比度随维度按 1/√d 衰减,邻近这个概念本身会失去意义。层级数据更极端,Poincaré embeddings 把树状的层级结构嵌进负曲率双曲空间,比零曲率的欧氏空间省得多。
真实数据的有效维度低于名义维度,欧氏距离套在上面会失真;维度灾难的根源,是几何用错了坐标系。
对称性是几何的另一半。一张图的节点没有天然顺序,你重排邻接矩阵,图的语义不变。这个对称性构成的群是置换群,图上的网络据此设计成置换等变的消息传递,推导在 Bronstein 等人的 Geometric Deep Learning 里写得很完整。
真实数据不住在欧氏空间里,它住在带曲率的流形和图结构上;把对称性写进模型,等于先把搜索空间砍掉一大截。
现实世界的映射与破局
回头看那笔账,很多现象就顺了。
量化里用因子暴露向量算距离,是在欧氏空间里做最近邻。高维下这种距离失去对比度,看起来相似的资产,在数学上可能和无差的点差不多远。Aggarwal 那 1/√d 说的就是这件事。
架构选择上也有对应。Transformer 把每个 token 和所有 token 连起来,注意力机制正是在一张完全图上做置换等变的消息传递,几何从格点换成了全域图,长程依赖因此不必再靠一层层传递。Geometric Deep Learning 的整个主张,就是把 Transformer 和 GNN 都从置换对称性里推出来。
工程上更直观。做量化或者做蒸馏,调学习率或者加层,动的都是同一个流形上的参数坐标,天花板没变。真正带来跃迁的动作,是把数据换进正确的几何:图像当格点用卷积,分子当图用消息传递,层级知识用双曲空间。
人脑也走这条捷径。猫的初级视皮层里有一批神经元只对特定方向的线条有反应,而这种朝向选择性在从没见过东西的幼猫身上就已经存在,说明它来自先天结构,不是被视觉经验教出来的(Hubel & Wiesel 1962 / 1963)。平移也一样,物体在视野里挪了位置,人还能认出是同一个东西,位置的变化被自动过滤掉了。这些先验就是对称性,它们在模型里的对应物就是等变层。
绕开维度灾难的路子,是把数据真实的对称性写成模型结构;算力只负责把这条路走完。
Awen 的认知总结与定论
我的定论:容量划出硬边界,几何决定这条边界画在哪个坐标系里。第一层里偏见是门票,第二层里 i.i.d. 是牢笼,到这一层,暴力堆叠终于变成了看得见的算术,数据要按容量的平方付账。同一件事在三个层上换了名字:偏见是学习的门票,对称性是押对方向的偏见,押错了门票就翻成第二层那把绞索。
可这里还剩一个没被解释的东西。既然容量有硬边界,为什么把参数堆到远超样本量,网络还能泛化?训练损失已经降到零,测试误差却还在往下走。LT-Book 第 11.7 节把这个矛盾直接摆在标题里:Double Descent and Benign Overfitting。曲线在经典理论预测的悬崖边上,又往前迈了一段。
那一段路,经典容量理论解释不了。更冷的问题是,一个非凸的损失曲面,凭什么梯度下降总能找到一个能用的解?
第四层要拆的就是这些。教材是三本,Roberts 的《The Principles of Deep Learning Theory》用重整化群和有效场论讲极深网络,Mehlig 的《Machine Learning with Neural Networks》提供统计物理的语言,Moitra 的《Algorithmic Aspects of Machine Learning》画出不可解的下界。到那里,划线的力量换成了相变和计算复杂度本身。
参考来源:
- Rademacher 复杂度定义见 LT-Book Definition 6.3
- 泛化误差与容量关系见 Theorem 6.4
- 带置信度的界见 Corollary 6.19
- VC 类容量估计见 Example 6.5
- 有限函数类估计见 Theorem 6.23
- K 层网络容量上界见 Theorem 11.26
- 双下降与良性过拟合见 LT-Book 第 11.7 节。谱图理论与图傅里叶变换见 DLG 第 2 章(2.4 节的谱图理论,2.5.1 节的图傅里叶变换,式 2.11)
- 图上的滤波器与图神经网络见 DLG 第 5 章(5.2 节的总框架,5.3 节的图上滤波器)。流形假设的可检验性见 Fefferman, Mitter, Narayanan, Testing the Manifold Hypothesis, JAMS 29(4), 2016, pp. 983-1049。高维距离对比度衰减见 Aggarwal, Hinneburg, Keim, ICDT 2001, pp. 420-434。双曲空间嵌入层级结构见 Nickel, Kiela, Poincaré Embeddings for Learning Hierarchical Representations, NeurIPS 2017。置换对称性与架构推导见 Bronstein et al., Geometric Deep Learning, arXiv:2104.13478。
原文链接:
- 张潼 LT-Book:lt-book.pdf
- Ma & Tang DLG:dlg_book.pdf
- Fefferman 等人的论文作者免费版:Testing the Manifold Hypothesis
- Aggarwal 等人的论文免费版:ICDT 2001
- Poincaré embeddings:arXiv:1705.08039
- Geometric Deep Learning:arXiv:2104.13478。
容量有硬边界,能不能绕开?下一篇拆相变:Hopfield 网络在 α_c≈0.138 一步崩进自旋玻璃相,深度网络的初始化也活在有序相与混沌相的夹缝里。最后落到不可解的那条线:张量秩是 NP 完全的,有一类问题,答案原则上存在,机器原则上算不动。
微信扫码 · 微信支付
支付宝扫码本文采用 CC BY 4.0 许可。欢迎转载与引用,请注明作者并附上原文链接。
Licensed under CC BY 4.0. Quoting and republishing are welcome with attribution and a link back to this article.
