5 minutes
5 minutes
5 minutes
我的第一性问题
大模型能写代码,能做视觉,能在围棋上碾压人类。但把它放进金融市场,放进宏观预测,砸了几十亿,表现还像个玩具。
第一层我们讲透了:偏见是学习的门票,几何是智能的投影。这套机制在静态世界里漂亮极了。
可一旦数据开始流动、博弈、反身,同一个模型就从天才变回白痴。
问题来了:底层到底断了哪根弦?
AI 在静态世界里学到的一切,都在动态世界里失效。
原著硬核推导的直觉化降维
先看 Durrett 的测度概率论(PTE)。机器学习整套框架压在一条假设上:数据是独立同分布的,i.i.d.。
独立,意味着今天的数据不影响明天。同分布,意味着分布本身不随时间变。UML 第一层的所有定理,都建立在这条假设上。
金融数据两条都不满足。今天的价格影响明天的预期,分布本身在不停地漂移。PTE 用测度论把这件事说死:一个非平稳序列,根本不存在一个固定的「真实数据生成分布」。你没法从一个不存在的分布里抽样。
机器学习却在假装它在。
i.i.d. 破产的那一刻,机器学习的理论地基就塌了。
再看鞅论。这是 PTE 里最锋利的一把刀。一个随机过程如果满足 E[Xn+1 | Fn] = Xn,就叫鞅。翻译成人话:给定你现在的全部信息,你对明天的预测,最聪明的答案就是今天的样子;明天的增量,你猜不到的期望是零。
这意味着,如果资产价格是鞅,对明天价格的最优预测,就是今天的价格。预测的数学死穴就在这里:要么市场是鞅,那任何模型能做的极限就是「预测等于现在」,剩下的全是噪声;要么市场不是鞅,那它必然存在可被利用的规律,而利用规律这件事本身,会改变规律。
在鞅的世界里,预测的极限是承认自己不可预测。
Durrett 的另一本书《随机过程基础》(EP)补上了反身性这一刀。马尔可夫链有平稳分布的前提,是转移概率固定。可金融市场里,参与者的策略会随着市场变化,转移概率跟着变。你算出平稳分布的那一刻,它已经不再是平稳的。
索罗斯管这叫反身性:预测行为改变了被预测的对象。
静态概率的死亡,从参与者开始适应游戏的那一刻起。
最后是 Shalizi 的《高级数据分析》。他讲的是最要命的一点:相关不等于因果。
高维数据里,随便两个变量之间都能找到统计相关性。维度越高,噪声之间撞出伪相关的概率越大。AI 在海量金融数据里挖出的「规律」,绝大部分是这种高维噪声之间的伪相关。
它把相关性当成因果来下注。这是数学上的必然。
高维世界里,把噪声当规律,是逃不掉的宿命。
现实世界的映射与破局
这套逻辑,解释了现实里一堆怪现象。
量化私募前几年靠因子赚得盆满钵满,最近几年集体失效。原因是同质化:当所有人都用同一套因子、同一个模型,策略就变成了市场本身的一部分。你预测的「规律」,在大家都预测它的时候,被反向交易吃掉了。这是反身性。
宏观预测更惨。经济有 regime shift,繁荣,衰退,危机的机制各不相同。模型在一个 regime 里学到的参数,换一个 regime 就全错。非平稳性让「历史回测」变成了一种自我安慰。
真实博弈里更直接:你的对手会读你的策略,会针对你调整。静态世界里没有对手,动态世界里每个人都是对手。
在动态反身的世界里,模型的失效是宿命。
Awen 的认知总结与定论
我的定论:AI 的偏见在静态欧几里得世界是门票,在动态反身性世界是绞索。
第一层里,偏见让学习成为可能。这一层,同一个偏见让学习在真实世界里翻车。UML 的 i.i.d. 假设是数学的地基,也是数学的牢笼。
那问题自然推到下一层:既然动态世界这么难,我们干脆堆更多的数据、更深的网络、更大的算力,能不能暴力突破?
第三层会回答这个问题:容量有硬边界,而且真实数据的形状,根本不在欧氏空间里。
下一本,从张潼的《机器学习算法的数学分析》开始。
参考来源:鞅论、条件期望与测度见 Durrett《Probability: Theory and Examples》;马尔可夫链、平稳分布与反身性见 Durrett《Essentials of Stochastic Processes》;相关性与因果推断见 Shalizi《Advanced Data Analysis from an Elementary Point of View》。
原文链接:Durrett PTE 官方免费 PDF:PTE5;Durrett EP 官方免费 PDF:EOSP2E;Shalizi 官方页:ADAfaEPoV
动态世界这么难,堆更多数据、更深的网络、更大的算力,能不能暴力突破?下一篇用张潼的 Rademacher 复杂度画出模型容量的硬边界,再看真实数据的形状为何根本不在欧氏空间里。
微信扫码 · 微信支付
支付宝扫码本文采用 CC BY 4.0 许可。欢迎转载与引用,请注明作者并附上原文链接。
Licensed under CC BY 4.0. Quoting and republishing are welcome with attribution and a link back to this article.
