5 minutes
5 minutes
我的第一性问题
在前面的总纲中,我们提到了 AI 学习的起点是偏见。但剥离掉哲学比喻,这个偏见在数学与几何底层到底长什么样?
大模型有些任务神迹般,有些任务蠢如草芥。同一个模型,换个任务,就从天才变成白痴。
我盯着这个反差看了很久,把问题收敛成一句:智能的起点,到底藏在哪里?
这个问题,我翻了两本教材才落地。一本是 Shalev-Shwartz 的《Understanding Machine Learning》,简称 UML,讲机器学习的理论地基。另一本是 Deisenroth 的《Mathematics for Machine Learning》,简称 MML,讲机器学习需要的数学。
UML 给的答案是:起点是偏见。MML 给的答案是:这个偏见,长着一副几何的样子。
智能的起点藏在偏见里,而偏见藏在几何里。
原著硬核推导的直觉化降维
UML 全书就一个骨架:PAC 学习框架。它把「学习」定义成一句话,从假设类 H 里挑一个假设,让它在训练数据上错得最少。这个动作叫经验风险最小化,简称 ERM。(UML 第 2 章)
真正的问题在 H 选多大。
如果你对世界不做任何预设,H 就是全体可能的函数。这时 ERM 会当场崩掉。想象一维数据上只有两个训练点:一个红点、一个蓝点。H 是全体函数时,穿过这两个点的曲线有无数条,每一条在训练集上的误差都是零。ERM 挑不出谁是「对的」,因为它面前摆着无穷多个零误差的解。你对第三个点的预测,纯靠猜。
这就是过拟合的极端形态。UML 第 5 章用「没有免费午餐定理」把它钉死:对任何一个学习算法,都存在一个数据分布,让它的表现和瞎猜完全一样。
这个定理的推论很硬:不预设,就学不了。你不对世界先相信点什么,世界就对你耍流氓。这个「先相信」就是归纳偏置,就是偏见。
偏见是学习的门票,没有它,任何数据都教不会你任何东西。
但 UML 到这里就停了。它证明了偏见必要,却没告诉我们偏见长什么样。MML 补上了这一半。
MML 从头到尾只干一件事:把抽象概念做成几何。你的偏见集合 H,落到高维空间里,是一组预设好的投影方向。学一个线性分类器,本质是把每个数据点正交投影到某个方向向量 w 上,用内积 w·x 算出一个带符号的分数,再用一个超平面把这个分数切开:高于某个值的归一类,低于的归另一类。(MML 第 2、3 章)
于是「偏见」有了实体。UML 说学习必须预设点什么,MML 说预设的那东西,几何上就是三件事:向量内积,正交投影,超平面切割。一个抽象的哲学词,被拆成了三个可以动手算的操作。
偏见有了实体。它是高维空间里一组具体的投影方向。
现实世界的映射与破局
这套「先有偏见,才能学习」的逻辑,走出教材之后解释力极强。
宏观研究里,你用任何模型看经济,都先预设了变量之间的关系。这个预设就是你的 H。预设错了,数据越多越危险,你会把噪声也当成规律拟合进去。这不只是 AI 的问题,是所有「从数据里找规律」的人的问题。
量化交易里,对自己 H 毫无自觉的人最危险。他以为自己在让数据说话,其实数据只会说他预设好的那种话。
工程落地也一样。调参、换架构、加层,本质都是在改 H。理解了这件事,你才知道自己每一步在动什么。
连人脑都这么工作。婴儿学语言,先天地带着「声音可以切分成有意义的单元」这个预设,才能从噪声里学出词汇。没有这个先验,语言根本无从学起。
你看到的世界,永远是你预设出来的那个世界。区别只在于,你有没有意识到自己预设了。
Awen 的认知总结与定论
我的定论:偏见是智能的起点。没有先验假设,学习无从发生;有了先验假设,学习才有了方向和边界。
这是第一层的结论,也顺手埋下一个更大的问题:偏见让学习成为可能,但偏见也会让学习在真实世界里翻车。
UML 的整套框架,假设数据是独立同分布的,是静态的。可真实的金融市场、商业世界、人脑认知,都是动态博弈,时序耦合,因果交错。i.i.d. 这个前提一旦在现实里破产,AI 的高维偏见会变成什么?
这是第二层要拆的事:随机性、时序,与因果断层。
下一本,从 Durrett 的测度概率论开始。
参考来源:经验风险最小化(ERM)与过拟合反例见 UML 第 2 章;没有免费午餐定理(NFL)见 UML 第 5 章;向量内积与正交投影见 MML 第 2、3 章。
原文链接:UML 官方免费 PDF:understanding-machine-learning-theory-algorithms.pdf;MML 官方免费 PDF:mml-book.pdf
偏见让学习成为可能,也让它翻车。UML 假设数据独立同分布,可真实的金融市场是动态博弈、时序耦合、因果交错。下一篇拆解随机性、时序与因果断层,看 AI 的偏见如何在动态世界里变成绞索。
微信扫码 · 微信支付
支付宝扫码本文采用 CC BY 4.0 许可。欢迎转载与引用,请注明作者并附上原文链接。
Licensed under CC BY 4.0. Quoting and republishing are welcome with attribution and a link back to this article.
《第一层·机制篇:偏见是学习的前提,几何是智能的投影》有2条评论