两个 AI 开会,为什么必须先说人话?

Reading Time: 6 minutes

一份作业,两个批改人

有一份作业要批改,题目里既有计算,也有大段文字要判断。你安排了两个 AI 一起干,一个擅长算,一个擅长读。分工很自然,会算的那个先把解题过程写成一段话,会读的那个再照着这段话下结论。

这套流程顺到没人会多问一句。可要是停下来看,会看到一件怪事,会算的那个 AI 明明已经在脑内算出了结果,却要先把它写成一串文字,再让对方逐字读回去。

那串文字,是它的想法,还是想法的翻译件?

两个 AI 之间流动的文字,只是想法的一次翻译。

请专家开会,却规定不许说母语

想象你请两位专家会诊,立的规矩很怪,两人都不许说母语,必须用一门两人都不熟练的第三方语言交流。每个想法都要先翻译过去,对方再翻译回来。

现在多个模型协作,干的就是这件事。一方把脑内的理解一个字一个字吐成文字,另一方再把这串字读回脑内。多出来的两次翻译,既丢信息,又费时间。时间费在逐字吐出上,模型每吐一个字都要重新算一遍,这是整套流程里最慢的一步。

损失是实打实的数字。论文的主实验里,同样是两个模型协作解一道题,用文字中转比直接交换内部状态慢 1.5 倍到 14 倍不等。准确率也差 3 到 5 个百分点。三个百分点,就是每一百道题里多错三道,是答对和答错的差距。慢上 3 倍是什么体感,同一件事别人等三分钟,这里只要等一分钟。这种差别放在高频协作里,会被一次一次放大。

论文自己给的总口径是这组数字,延迟平均快 2.5 倍,准确率比单个模型高 6.4% 到 14.2%,比文字通信高 3.1% 到 5.4%。逐配置的明细在表 4。

文字这层翻译,同时收两笔钱,一笔信息损耗,一笔等待时间。

不写出来,直接把笔记递过去

模型读题的时候,脑内会随手记下一叠笔记。这叠笔记,当成模型一边读一边打的草稿就好。草稿里存着它对每个词的关注和联想,比最终写出来的那句答案信息量大得多。

过去的文字协作,等于把草稿誊成正式报告再递出去。清华的研究者换了做法,不誊写,把一方的草稿直接递给另一方。两家的草稿格式不同,模型结构和词表都不一样,于是他们训练了一个转接器,把一方的草稿搬进另一方的格式再合并。转接器里还装了一个会自己挑的门,决定把草稿灌进对方哪几层最有用。

这套做法一句话就能说清,用一个小网络把笔记直接搬运,再让一个门决定搬进哪几层。训练时只训这个转接器和门,两个大模型本身一动不动。这篇论文已经发表在国际学习表征会议 ICLR 2026,不是待审的预印本。

绕过文字这层翻译,两个模型可以直接交换各自的草稿。

草稿的另一笔账

直接递草稿省了时间,可草稿有个麻烦,它是私人笔记,人看不懂。

文字之所以成为模型之间的事实标准接口,恰恰因为它谁都能读。出问题能翻日志,监管能审,第三方能查。草稿是一串高维数字,出了错你连它怎么想出来的都看不出来,追责无从谈起。拿可解释性换效率,这笔账划不划算,论文没有替你算。

论文自己承认两条局限。弱的模型给强的模型递草稿,可能把对方带偏,这个坑文字协作也有。多个模型两两直连,训练成本随模型数量上涨,论文只探索到两三个模型,规模化还没解决。

至于可审计性和缓存格式要不要标准化,论文没有讨论,这里标成论文未涉及。跨厂商倒是真做到了,同一套方法在三个不同的开源模型家族之间都跑通。真正的前提,是你得能拿到模型内部的草稿。只开放接口却不开放内部状态的闭源模型,暂时进不了这场直连。而且每换一对模型,就要单独训一个转接器,不是一劳永逸的通用翻译。再往商业上看一步,缓存格式现在各家各写各的,直连要真正用起来就得分头适配,谁先定下格式谁就多了议价权。这是论文之外的问题,论文只字未提。

缓存直连省下的时间,是用谁也看不懂换来的,这笔交换论文没给结论。

什么情况下值得用

落到自己身上,判断标准很简单,看场景就行。

情况该选哪种
合作对象里有闭源模型,读不到内部草稿文字
需要留痕,出问题要逐条追责文字
结果要交给人审文字
两个模型都开源,草稿都能读缓存直连
高频批量,一秒钟都不想多等缓存直连
对延迟敏感,模型又固定不常换缓存直连

缓存直连不是要取代文字,它是在能读草稿的前提下,给高频协作多留了一条更快的路。

两个 AI 开会,未必要先学一门外语。等它们都愿意把草稿摊到桌面上,那门第三方语言就可以不学了。

参考来源

  • 论文摘要与第 1 节(总口径):延迟平均快 2.5 倍,准确率比单一模型高 6.4% 到 14.2%,比文本协作高 3.1% 到 5.4%。
  • 论文正文第 4.2 节与表 4:逐配置明细,相对单一模型的平均准确率提升分别为 11.00%,9.64% 和 11.88%;相对文本协作分别为 5.36%,4.15% 和 3.06%;延迟快 3.46 倍,1.51 倍,14.41 倍。
  • 论文正文第 5 节:两条局限,弱模型误导强模型,多模型互连训练成本随数量上涨。
  • 论文正文第 3.3 节:投影融合,可学习门控选层,模型冻结只训转接器。
  • 论文正文第 4.1 节:覆盖 Qwen,Llama 与 Gemma 三个模型家族,任务为 OpenBookQA,MMLU-Redux,ARC-Challenge 与 C-Eval。
  • 论文正文第 6 节与未来工作:仅提及隐私方向展望,可审计性与缓存格式标准化未讨论,属论文未涉及。

原文链接

  • 论文 HTML 全文(v2):https://arxiv.org/html/2510.03215v2
  • 论文摘要页:https://arxiv.org/abs/2510.03215
  • 开源代码仓:https://github.com/thu-nics/C2C


深入这个系列

这篇讲的是模型之间的通信层。它上面那件事更根本:模型的表示空间长什么样,以及这个空间如何决定它能装下多少、走得多远。四层走完,从偏见与几何到容量天花板与统计物理的边界。

资料与社群

文中引用的 10 本经典原版教材 PDF 已整理完毕。欢迎前往小红书搜索关注 AwenDXB,在主页直接加入【读者群】获取网盘链接与长文导读。

请喝一杯咖啡
这些内容都是我一个人查资料、跑数据、核事实写出来的。如果对你有用,可以请我喝一杯咖啡。
微信扫码 · 微信支付微信扫码 · 微信支付
支付宝扫码支付宝扫码
个人收款码 · 微信支付 / 支付宝

本文采用 CC BY 4.0 许可。欢迎转载与引用,请注明作者并附上原文链接。
Licensed under CC BY 4.0. Quoting and republishing are welcome with attribution and a link back to this article.

发表评论