TypeSafe 融了 8.7 亿美元:不聊天的模型,为什么更贵

Reading Time: 14 minutes

Read in English →

结论先行

2026 年 10 月 9 日,TypeSafe AI 宣布完成 8.7 亿美元 A 轮融资,估值 75 亿美元,a16z 领投,红杉与 DCVC 跟投,a16z 的 Martin Casado 进入董事会。同一条消息当天在 Hacker News 首页拿到 377 分。

金额本身不新鲜。今年破十亿美元的 AI 融资已经多到不构成新闻。

值得写的是时间线。9 月 15 日这家公司才结束两年隐身,拿的是 4000 万美元种子轮,估值 2 亿美元。24 天之后,同一个团队的定价变成 75 亿,涨了 37.5 倍。

而我 9 月 21 日写过一篇 Jev 的实测报告,Jev 就是这家公司的第一个模型。那篇里的数字是在我自己机器上跑出来的:延迟 362 毫秒对 922 毫秒,单次成本 0.0000255 美元对 0.0000451 美元。厂商宣传”便宜 400 倍”,我的场景里是 1.8 倍。

所以这篇文章只做一件事:把支撑这个 75 亿的技术主张,拿去跟我三周前的实测数据对一遍。哪些结论站得住,哪些被我的数据拆掉了,哪些我当时就标了”还没验证”。

这轮融资的完整时间线

先把账摆清楚,因为这条时间线本身就说明了定价是怎么完成的。

九月十五日,TypeSafe 结束两年隐身,宣布 4000 万美元种子轮,DCVC 领投,估值 2 亿美元。同日发布第一个模型 Jev。福布斯当天的报道标题是《这家 2 亿美元的公司想修好 AI 的过度自信问题》,估值数字的来源是”一位熟悉交易的人士”。

四天后的九月十九日,Sacra 记录到市场已经在讨论”以约 100 亿美元估值融资”。注意这个数字当时没有成交,只是讨论。

十月九日,落定的数字是 75 亿。比九月流传的讨论价还低。

这中间发生了什么,官方公告没有解释。可观察的只有一件事:a16z 合伙人 Martin Casado 进了董事会,红杉从种子轮跟到 A 轮。

红杉的 Pat Grady 后来给了一个解释:Jev 发布七天内,年化收入跑到 1 亿美元。这个数字来自投资人转述,不是财报,我找不到第三方核对。如果它成立,七天的速度在软件史上也没有先例。

价格从 2 亿跳到 75 亿,中间隔着 24 天和一次产品发布。这个跨度已经不是”业绩推动估值”能解释的范围,它更像市场在给一类新东西定价。

那么问题就变成:他们到底在卖什么。

数据中心冷通道内,运维人员从机架抽出硬盘托架
示意图 · 图源 Pixabay

他们卖的到底是什么

Jev 不写文章,不回问题,不做客服。

你给它一段材料加一道题,它给你一个可以排序、可以卡线的数。官方定义了三类问题形状:Noul 问”是不是”,返回一个 0 到 1 的概率;Choice 问”选哪个”,返回选中项和每个选项的概率分布;Score 问”在哪个等级”,返回加权分和每档概率。一次调用可以同时问一堆问题。

它和普通大模型的分工是这样的。大模型是”你给它一段话,它给你一段话”。Jev 是”你给它材料,它给你一个数”。写代码的人负责流程,它负责流程里那些需要语感的判断。

两个名字都是有来历的,来历本身就是商业主张。

“System One”借的是卡尼曼《思考,快与慢》里的系统一,快速、直觉、不费力的判断,对标大模型那种慢而贵的推理。”Jev”取自经济学家 William Stanley Jevons,就是杰文斯悖论那个杰文斯:煤的利用效率提高之后,煤的消耗总量反而涨了。放在这里,它编码的赌注是智能价格每降一个数量级,用例就多一个数量级。

训练方法叫 RLCD,Reinforcement Learning for Calibrated Decisions。这个名字是对着 RLHF 立的,而 RLHF 正是 TypeSafe 的 CEO Diogo Almeida 在 OpenAI 参与发明的技术,也是 ChatGPT 背后的对齐方法。官方对 RLHF 的指责很具体:它让模型过度自信、丢掉分布里的次要模式、在需要可靠性的场景里必须有人盯着。

这套说法翻译成钱,落成三个卖点:类型化输出、带置信度、便宜。后面两个我实测过。有一个对上了,有一个没对上。

我三周前的实测数据,对上了哪些

这一节的数据全部来自 9 月 21 日那篇报告,是在一台 Mac 上跑出来的,采样上千次真实调用。当时的结论是针对它自己的模型和它自己的定价,跟这轮融资无关。

速度与成本:1.8 倍,不是 400 倍

先说延迟,这部分对上了。

同一个分类任务,Jev 的中位耗时 362 毫秒,最小 322,最大 389。DeepSeek 的中位 922 毫秒,最小 576,最大 977。快 2.5 倍。

更有意思的是波动。Jev 的八次采样全部落在 67 毫秒的区间内,DeepSeek 的区间是 401 毫秒。对线上服务来说,稳定的 350 毫秒通常比平均 900 毫秒、偶尔 600 毫秒更好用,因为超时阈值好设。

成本这一侧就出现分歧了。

同一个任务,Jev 消耗 607 个输入 token,按官方每百万 0.042 美元算,单次 0.0000255 美元,输出不计费。DeepSeek 消耗 272 个输入加 25 个输出,按 V4-Flash 价目表算,单次 0.0000451 美元。

便宜 1.8 倍。厂商说的是 400 倍。

差距来自两个地方。Jev 的输入 token 反而更多,因为每个问题的定义都要占位。而下游的 DeepSeek 本身已经极便宜。

还有一个我当时标了”尚未实测”的档位,现在回头看更值得注意。DeepSeek 的缓存命中价是每百万 0.0028 美元,比未命中便宜五十倍。判定任务里问题定义永远不变,变的只有被判定那段材料。如果前缀能稳定命中缓存,DeepSeek 单次成本会掉到 0.0000078 美元左右,反过来比 Jev 便宜三倍。

这一档是按价目表推算的,没上机跑过。写在这里是因为它足以推翻”Jev 一定更便宜”这句话。而它成立的条件下,TypeSafe 最硬的那个卖点就松了。

真正的差别在分辨率

上面那些都是钱和速度。改变我判断的是下面这个实验。

我取了 12 篇真实的 arXiv 论文摘要,写了一道 1 到 5 分的题,问信息密度。同一道题、同一套等级描述,分别交给 Jev 和 DeepSeek。

结果是,DeepSeek 给出的 12 个分数里只有两个不同的值:5 分和 3 分。9 篇打了满分,75% 直接撞到天花板。Jev 给出四个不同的值,从 2.17 到 4.00,没有一篇顶格。

DeepSeek 并不是瞎给分,它把三篇质量偏水的摘要挑出来了,那三篇 Jev 也判低。问题在于它的量程只用了两格。剩下九篇全挤在满分上,你想按分数排序,排出来的结果没有信息。

这是大模型在打分任务上的通病。它的训练目标是”给出一个像人写的回答”,不是”把一批东西排出顺序”。任务本身要求结果可比较的时候,生成式模型会把答案收敛到众数上,因为那样最安全。

Jev 也不是完美的排序器。它把九篇都给了 4.00,粒度同样偏粗。但它至少在好和坏之间有界线,而大模型那条线根本不存在。

这一条比速度和成本都重要。它解释了为什么值得把判断从大模型里拆出来:拆出来的东西是分辨率。

顺带说一下稳定性,这也是这轮融资里被反复引用的数字。我拿 5 篇摘要、同一个问题重复问 8 次,Jev 每题概率的平均标准差是 0.0033。官方公布的同类实验数字是 0.0102。我们场景下更稳,而且是独立跑出来的。

这里要标一个测量缺陷。DeepSeek 那一侧我做了二值化处理,而它在重复采样里每次都回答同一个值,二值化之后标准差恒为零。这个零是测量假象,不能写成”DeepSeek 更稳定”。可说的只是:恒定输出既没有方差,也没有信息。

便宜不等于划算:回本线在下游

知道怎么用之后,我拿它做了两件真事。

第一件是筛论文。我把一篇 25475 词的论文全文切成 72 块,让它挑出与某个具体问题相关的段落。第一版判据我写成一句话塞进四个条件,结果 72 块全部被丢掉,连明显相关的机制段落都没留下。改成一个问题只问一件事之后,压缩率回到 57.5%。

但这一版是亏钱的。压缩 57.5% 省下的钱,抵不过打分本身的开销,净亏 17.4%。

第二件是压缩对话上下文。我从自己的会话库里取了 100 条最大的工具输出,合计 55 万 token。这一版压缩率 79.2%,净省 54.1%。

同一个模型、同一个下游,两次结果一正一负。差别来自内容本身可丢弃的程度,工具输出比论文正文可丢得多。

把两件事放在一起能算出一条线:在下游是 DeepSeek 这种价位时,压缩率要到七成以上,过滤才开始赚钱。如果下游换成每百万 2 美元的前沿模型,同样的配置立刻省 71%。

所以 Jev 的价值不取决于它自己,取决于下游有多贵。

算过本地模型和云 API 的账之后再看这句会更清楚。这句话在读融资新闻时值得记住。一家把”便宜”当核心卖点的公司,它的真实价值锚在别人的价目表上。下游每降一次价,它的相对优势就缩一圈。而 2026 年的现实是,下游在疯狂降价。

官方拿我们这套框架做了实验

这一段是整篇里最具体的连接点。

官方有一篇 cookbook 叫 skill suggestion,实验对象是 Nous Research 的 Hermes 技能库,182 个技能全部作为样本。文档原文写着一句话:Hermes 默认把技能描述截断到 60 个字符。

他们描述的症状很具体。在 60 字符的宽度下,”编辑 pptx 的技能”和”创作 pptx 的技能”读起来几乎一样。用户要一份路演稿,agent 可能加载错的那一个。如果这一轮根本不需要技能,它也可能硬加载一个,因为一串名字本身就引诱人去猜。

方案是两次请求。第一次用一个 Choice 扫全部 182 个技能,同时用几个 Noul 判断这一轮到底需不需要技能。第二次只细读前三名,带上完整描述和正文开头,并且允许全部否决。胜者的名字写进系统提示的一行。

488 次请求,被测 agent 是 claude-haiku-4-5。错误加载率从 16.8% 降到 7.3%,不需要技能时硬加载的比例从 9.8% 降到 4.0%。表格里还有第三行:直接把正确答案给 agent,错误率是 2.5% 和 1.2%。也就是说错误率的地板不是零,给了对的技能它也不是每次都加载。

我写那篇文章的时候,正在给自己建这个 Jev 技能。工具的报错原话是,新技能的描述必须塞进 60 字符的系统提示预算。我被迫把描述砍到 47 个字符。

那条上限被写进了他们的评测,而我恰好撞在上面。

一家五天前估 2 亿、五天后估 75 亿的公司,验证自己的判断原语时,用的样本是我们正在用的这套框架。这件事本身不构成技术优势的证据,但它解释了为什么这篇报告值得写第二遍。

外部质疑:两条需要回应的反驳

融资新闻的中文转述里,这两条基本都被省掉了。

准确率这一侧有一组第三方测试。直接问”这是不是钓鱼邮件”,Jev 得 62.6%,落后 Claude Haiku 4.5 的 81.3%。中文技术博客「未闻Code」复核过这个结果。

这条对它的主张伤害不小。一个二元的是非判断,本来就该是 Noul 原语的主场,而它输给了一个更小的通用模型。如果买点是”便宜且准的判断器”,这里准的没做到。

更根本的一条质疑针对它的定位。有评论认为 Jev 本质上是”快速判断加压缩”的通用分类器,在各案例中打不过精调过的小模型,可能连贝叶斯网络都打不过,新概念是围绕花钱理由包装出来的。

我自己的数据没法反驳这一条,反而部分支持它。前面那个筛论文的实验净亏 17.4%,判据写错一版还导致 72 块全被丢弃。在那个任务上它确实不值那个钱。

能站住的回应只有一条,而且要说清楚边界:它的价值落在排序分辨率、输出一致性和边际成本上,单任务的绝对准确率反而是最弱的一环。我测出的 2.17 到 4.00 的分布,和 0.0033 的标准差,是这套主张里我实测过、能复现的部分。

但它撑不起”通用判断层”这个说法。至少在钓鱼邮件这一类的任务上撑不起。

领投方自己怎么说

这轮融资由 a16z 领投,进董事会的是 Martin Casado。他今年四月接受《金融时报》采访时说过几段话,值得跟他五个月后的这笔投资放在一起读。

“我越做这行,越觉得造这些模型没那么难。我们觉得它们了不起,是因为这本来就是个小众领域,做的人不多。创新不再关于聪明,而是关于堆积资源。”

“一个模型能保持多久的相关性?三到六个月。然后你得做下一次训练。这些模型完全没有持久性。”

“你面对的是史上折旧最快的资产,和史上增速最快的公司。没人能回答它们会收敛到哪里。”

一个认为模型没有持久性、造模型只是在堆积资源的投资人,为一家模型公司付了 75 亿。

把这四段话和他五个月后的那张支票放在一起,最直接的印象是自相矛盾。他同一场采访里还给了另一种解释,值得读完再下结论。他描述自己的配置逻辑是:如果大实验室拿走 80% 的价值,那就要有大实验室的敞口;但如果价值快速下移到应用和更小的模型,那也要有那一层的敞口。

Jev 正好是”更小的模型”那一层。从他自己陈述的框架看,这笔投资是自洽的。

真正矛盾的地方在价格。他的框架说价值会下移到小模型层,而他用 75 亿给这个层里的一家 24 天大的公司定了价。框架能解释”投什么”,解释不了”投多少”。

a16z 官号转述 Almeida 诊断时配了一句口号:”我们造产品,不造神。”这句话对一家估值 75 亿的公司来说,很难说清到底是谦逊还是别的什么。

对做产品的人意味着什么

把融资的噪音去掉,这件事对一个正在搭工作流的人只有一层实际含义:判断可以从生成里拆出来了,而且拆出来便宜得多。

搭过私有 agent 栈的人对这几步不会陌生。你的流程里总有几步不需要一段话,只需要一个能排序、能卡线的数。路由、筛选、打分、放行。过去这几步交给大模型,纯粹因为当时没有别的选择,跟它擅不擅长无关。

网络交换机 RJ45 端口微距特写,插孔金属触点清晰可见
示意图 · 图源 Pixabay

我实测出的三个适用条件是这样的。要用同一个标准重复判断几万次,一致性比单次准确率重要。下游模型越贵,这一步越值。任务要的是排序,不是分类的时候它才能加分。

反过来的条件同样清楚。下游在降价。我算过,如果 DeepSeek 的前缀缓存能稳定命中,它的单次成本会掉到比 Jev 更低。这条推算还没上机验证,但方向明确:把”便宜”当核心卖点的公司,它的相对优势锚在别人的价目表上。

至于 75 亿在给什么定价,我的判断是接口,不是一个模型。类型化输出加校准置信度,如果它变成机器判断的标准形状,谁定义这个形状谁就占住了一层。这个判断我验证不了,但它是价格暗示的东西。

哪些判断我到现在还没验证

这篇里凡是没验证的,我列在这里。

发布七天内年化收入 1 亿美元,来自投资人转述,没有财报和第三方核对。Fortune 500 里有三分之一在用 Jev,是官方公告的说法。官网首页那句”快 193.6 倍、便宜 444.6 倍”,基于厂商自选的任务口径,我的场景里换算出来是 2.5 倍和 1.8 倍。

DeepSeek 缓存命中后比 Jev 便宜三倍,是按价目表推算的,我没跑过。对话上下文压缩的省钱那一层我验证过,质量那一层还是开的。我用”标识符是否在后续消息里再次出现”当标准检查丢弃是否安全,100 条样本里找不到一个高复用的正例,Jev 分数与实际复用率的相关性只有 0.245。

中文和英文的表现差异,官方说明里承认其他语言表现不平等。我实测 20 组中英同义配对,中文平均分低 0.042。这个数比我自己第一次测出来的小得多,第一次只做了 5 组,看到 0.83 对 0.96 就下了”中文被系统性压低”的结论,那是小样本的问题。

最后一个:这篇文章用的是三周前的实测数据。Jev 的模型版本、价格表、原语定义都可能已经变了。我没有重新跑一遍,所以上面所有数字的有效期到 9 月 21 日为止。

参考资料

TypeSafe AI, TypeSafe A raises Series AI(https://typesafe.ai/blog/series-ai)—— 8.7 亿美元 A 轮、75 亿美元估值、a16z 领投与 Martin Casado 进董事会的原始出处

Forbes, This $200 Million Startup Wants To Fix AI’s Overconfidence Problem(https://www.forbes.com/sites/the-prompt/2026/09/15/this-200-million-startup-wants-to-fix-ais-overconfidence-problem/)—— 9 月 15 日种子轮 2 亿美元估值与创始人背景

Business Wire / Yahoo Finance, TypeSafe AI Emerges From Stealth With $40M in Funding(https://finance.yahoo.com/technology/ai/articles/typesafe-ai-emerges-stealth-40m-190000776.html)—— 4000 万美元种子轮通稿与三位创始人的职务

Sacra, TypeSafe AI revenue, valuation & funding(https://sacra.com/c/typesafe-ai/)—— 9 月 19 日百亿美元估值讨论、七天内 1 亿美元年化收入的转述

Financial Times, a16z’s Martin Casado: It’s not that hard to build AI models(https://www.ft.com/content/01eacc3a-b461-4271-8c62-032c71dd90ba)—— 本文引用 Casado 关于模型没有持久性、堆积分资源与投资配置的四段原话

a16z 官号帖文(https://x.com/a16z/status/2104580361254810080)—— “We build prod, not God” 与 Almeida 诊断的转述

bestblogs, Jev Released: TypeSafe AI’s System One Decision Model(https://www.bestblogs.dev/en/explore/topics/typesafe-jev-release)—— 钓鱼邮件测试 62.6% 对 81.3% 的复核、以及”未训练通用分类器”批评的汇总

Hacker News 讨论帖(https://news.ycombinator.com/item?id=50023450)—— 10 月 9 日 377 分、278 条评论的现场

本刊, Jev 深度实测:快 2.5 倍、便宜 1.8 倍,以及那个更重要的差别(https://awendxb.com/jev-deep-test-resolution/)—— 本文所有标注实测的数字、方法与测量缺陷的出处在


以上内容基于公开信息与本机实测整理,仅供学习参考。文中实测数据来自作者自有环境,不同任务与配置下的结果可能有差异。

请喝一杯咖啡
这些内容都是我一个人查资料、跑数据、核事实写出来的。如果对你有用,可以请我喝一杯咖啡。
微信扫码 · 微信支付微信扫码 · 微信支付
支付宝扫码支付宝扫码
个人收款码 · 微信支付 / 支付宝

本文采用 CC BY 4.0 许可。欢迎转载与引用,请注明作者并附上原文链接。
Licensed under CC BY 4.0. Quoting and republishing are welcome with attribution and a link back to this article.

发表评论