结论先行
很多人算本地部署成本,第一反应是盯电费。一台标价五万多元的机器,我把它和自己的 AI 账单放在一起算完之后,得到的第一个结论是:电费在这个决策里根本不重要。
真正决定这笔账成败的只有两个变量,一个是这台机器几年后还能卖多少钱,另一个是你自己每个月到底用掉多少 token。前者我用真实成交价校准过,后者需要你代入自己的数字。
这篇是《本地模型能不能跑起来:先算内存账,再动手》的下一步。内存账回答的是「跑不跑得起来」,这篇回答的是「值不值得跑」。两篇合起来是一套完整的判断流程,而且都不需要你先下载任何模型。
为什么先算这笔账
我在上一个阶段踩过一个坑:把注意力全放在「模型多大、能不能装下」上,装下之后才发现真正的门槛在别处。价格这件事同理,绝大多数讨论都在比「API 每百万 token 多少钱」和「本地电费多少钱」,而这两个数字在整笔账里都不是主导项。
先把范围界定清楚。本文算的本地部署成本只涉及一种情形:同一个模型能力水平下,自己买机器跑划算,还是继续用 API 划算。如果你的需求是隐私、离线、或者不被单方面改价和停服,那属于可得性问题,它的价值不能用省钱来折算,本文最后会单独说。
三个输入,全部来自官方
算账最怕用估算值。这三个数字我全部取官方来源,并注明取值日期。
机器价格。Mac Studio,M5 Ultra 芯片,36 核中央处理器与 80 核图形处理器,256GB 统一内存,1TB 存储。Apple 阿联酋官网在 2026 年 9 月 24 日的报价是 47,849 迪拉姆。同一配置在美国官网折算约 10,899 到 11,299 美元之间。这个差价本身值得记一笔,因为整条账的结论对价格很敏感。
电价。迪拜水电局官网的现行档位:住宅与商业用电 0 到 2000 度每月为每度 0.230 迪拉姆,燃油附加费本期为每度 0.060 迪拉姆,以上均不含 5% 增值税。所以边际电价用 0.290 迪拉姆,含税 0.3045 迪拉姆。
功耗。Apple 官方支持文档公布的墙插实测值,官方文档里 M3 Ultra、80 核图形处理器那一档待机 9 瓦,满载 270 瓦。这里必须说明:官方「满载」的定义是运行一个最大化处理器占用的计算密集测试,不是模型推理的典型负载。下面我按 200 瓦作为推理负载估算,并在局限一节标注这是估算。
先算最容易被高估的那一项:电费
按每天不同使用时长的推理负载计算:
- 轻用 2 小时每天,一年约 218 度,合 18 美元。
- 常用 8 小时每天,一年约 637 度,合 53 美元。
- 满载 24 小时每天,一年约 1752 度,合 145 美元。
六年下来,最重的用法总共 872 美元,不到整机价格的一成。这个结果和直觉相反,原因在于高能效芯片待机功耗极低,而推理负载很少持续拉满。

所以电费不是决策变量。真正的决策变量是下面这项。
真正主导本地部署成本的是硬件折旧
整机成本减去将来卖掉的残值,就是净成本。所以残值估计的准确性直接决定结论。
我不拍脑袋,用真实成交价倒推。Swappa 在 2026 年 9 月的实际成交记录:2022 年发布的 M1 Ultra 机型,1TB 存储版成交 2292 美元,2TB 版 3088 美元,4TB 版 3757 美元。对比该机型 2022 年 3999 美元的首发价,四年多之后大约保留了 57%。
但这个比例不能直接套到高配机上。原因有两条。其一,苹果的内存和存储升级在转售时很少能拿回全价,二手回收商在估价说明里明确写了这一点。其二,高内存配置的买家池很窄,愿意为 256GB 统一内存付二手溢价的买家比标准配置少得多。
还有一条反向因素需要放进来。2026 年出现了全球内存芯片短缺,叠加本机运行大模型的采购潮,苹果已经停掉了 128GB 和 512GB 两个档位,并把 256GB 的升级价格上调。短缺会同时产生两个方向的作用:短期内稀缺托住了高内存机型的残值,但短缺缓解或采购潮退去之后,买家池最窄的顶配会跌得最狠。
所以我给三档残值,而不是一个数字。
持有一台新机的年均成本
按六年持有、包含六年电费计算:
- 乐观情形,残值保留 45%,六年净成本约 7483 美元,年均 1247 美元。
- 基准情形,残值保留 30%,六年净成本约 9437 美元,年均 1573 美元。
- 悲观情形,残值保留 15%,六年净成本约 11392 美元,年均 1899 美元。
这三档和你的 API 支出放在一起才有意义。
关键的一步:机器替代不掉全部工作
这是整笔账里最容易算错的地方。买了机器不等于 API 账单归零。本机跑开源模型在困难任务上还追不上前沿闭源模型,所以真实情形是混合使用:常规量的活交给本机,最难的活仍然走 API。
于是比较的对象不是「机器年均成本」和「你的全部 API 支出」,而是「机器年均成本」和「被替代掉的那部分 API 支出」。
我用三个替代率代入。假设你现在的 API 支出是每周 100 元人民币,合一年约 776 美元。按六年、基准残值计算,机器净成本约 9437 美元。那么:
- 如果 API 支出不增长,替代 70% 的活,六年累计省下 3259 美元。API 仍然更便宜。
- 如果 API 支出每年增长 25%,替代 70%,六年累计省下 6116 美元。API 仍然更便宜。
- 如果 API 支出每年增长 50%,替代 70%,六年累计省下 11288 美元。机器开始更便宜。
- 如果替代率能到 90% 且年增 25%,六年累计省下 7860 美元,接近打平。
所以有一个清晰的边界:替代 70% 的前提下,你的 API 支出需要每年增长约 43%,这台机器才刚好打平。替代 90% 的话,门槛降到约 32%。
这个数字就是你该拿去问自己的问题:我的用量会以每年四成的速度涨吗?

但价格本身正在崩,这才是最要紧的一层
算到这里有个前提开始松动。上面所有比较都假定 API 价格不变,而这个假定在 2026 年不成立。
Hacker News 首页上有一篇被讨论很多的文章,标题是《token 便宜到不值得计量》。它的核心论点是:机器学习智能的单价正在以每年几个数量级的幅度下降,而且没有放缓迹象。它给出的推论比我上面那张表更激进,包括三到六年内消费级硬件就能跑出当前前沿质量的模型,以及很快限制 AI 使用的会变成质量和可得性,而不是 token 的数量。
我没有能力验证这个推论会走多快,但它至少说明一件事:把「哪条路每百万 token 更便宜」当成主要判据,这个判据本身有保质期。价格下滑的速度如果继续,我上面算出来的交叉点会整体前移,机器变得更容易划算是很可能的。
同期还有一组数字可以作证。Artificial Analysis 的独立测试里,Mercury 2.5 的输出速度是每秒 770 个 token,输入每百万 0.25 美元、输出 0.75 美元,上下文 26 万。这意味着在速度和价格两个维度上,云端的领先幅度在扩大。本机要赢,靠的不会是这两个维度。
所以判断的顺序应该反过来
如果你的出发点是省钱,那么正确的顺序是:
先量出替代率。你手上任何一台能跑模型的机器都能帮你量。把一个月里真实用过的任务按类型分开,看哪些本机接得住、接出来质量差多少,得到的是百分比而不是感觉。
再看增长。你过去半年的支出曲线是什么形状。如果它基本持平,价格账算不出机器的合理性。
最后才看价格。而且看的不是「比 API 便宜多少」,而是「这台机器的净成本,也就是买入价减掉将来残值,能不能被你替代掉的那部分支出覆盖」。
至于为什么有人在价格不划算的情况下依然选择本机,答案通常不在钱。隐私、离线可用、不被单方面改价或停服、以及把整套流程掌握在自己手里,这些都是真实的收益,但它们不该被包装成省钱。把它们分开说,判断会清楚得多。
必须说清的局限
推理负载的功耗我按 200 瓦估算,不是实测。Apple 官方只公布了待机与满载两个端点,中间没有曲线。如果你的实际负载长期贴近满载,电费那一节要上调,但结论不会变,因为电费占比太小。
残值三档是我基于真实成交价与二手市场的判断,不是预测。高内存机型的样本量很小,误差可能很大。
替代率我取了 50%、70%、90% 三档,它们的差距足以改变结论。这三个数没有一个是实测值,必须用你自己的任务去测。
上面所有关于 API 价格的比较都用 2026 年 9 月的价格。这个前提有保质期,而且可能很短。
这份本地部署成本账只算钱,没有算时间成本。自己维护推理服务、处理版本升级、排查跑不通的模型,这些都要花时间,而时间在账上是零。
数据来源
- 机器价格与配置来自 Apple 阿联酋官网,2026 年 9 月 24 日。
- 功耗数据来自 Apple 官方支持文档 《Mac Studio power consumption and thermal output》。
- 电价来自 迪拜水电局官网档位表与当期燃油附加费,含 5% 增值税。
- 残值来自 Swappa 二手成交记录,2026 年 9 月更新。
- API 价格来自 OpenAI、Anthropic、DeepSeek 各自官方定价页。
- 每秒 770 token 与价格来自 Artificial Analysis 的模型页面。
- 《token 便宜到不值得计量》来自 jyn.dev,为个人博客文章,非同行评审。
微信扫码 · 微信支付
支付宝扫码本文采用 CC BY 4.0 许可。欢迎转载与引用,请注明作者并附上原文链接。
Licensed under CC BY 4.0. Quoting and republishing are welcome with attribution and a link back to this article.
