Kimi 暂停会员开放,真正卡住的从来不是显卡
7 月 19 日,月之暗面挂出一份公告,说 K3 发布后 48 小时用户请求量大幅超预估,暂停会员开放。
同一份公告,工程师看到的是 KV cache 打满、推理队列超时;财务看到的是每一个新用户都在扩大单位负毛利,融资在被快速消耗。
对普通用户来说,这只是又一次"AI 服务扛不住"。但你把过去两三年的类似事件拉出来看:2023 年 11 月 OpenAI 暂停 ChatGPT Plus 订阅、2024 年 5 月 Anthropic Claude 3 Opus 出现容量限制、更早的 Midjourney 关闭免费通道。这是一个反复上演的剧本,每次换个包装。
真正卡住的不是显卡,是单位经济学。
把"算力紧张"翻译成"单位毛利"
大部分人把"算力紧张"当成供给侧问题——GPU 到位就能解决。
但如果只是硬件,OpenAI 早就该好了。真实场景是这样的:
每一个新增用户,不管是免费还是低价会员,都在消耗算力。这些消耗折算成钱,是有明确单价的(H100 每小时 2-4 美元,加上电力、机房、运维)。当会员费收进来的钱,不够覆盖这些消耗时,每增加一个用户,账面亏损就多一分。
这时候暂停开放,不是硬件被动断电,是运营主动踩刹车。GPU 到货也解决不了这个问题——你继续开门,只会烧得更快。
长上下文赛道格外容易翻车
Kimi 从一开始就主打长上下文,从 20 万 token 一路推到 100 万 token。这条路有个不太好听的事实:
推理成本随上下文长度非线性增长。
同一个模型,8k token 的请求和 200k token 的请求,占用的 KV cache 和显存驻留时间可以差 20-40 倍。
一个每天问三五个问题的普通用户,和一个每天丢十份长文档进来做总结的重度用户,他们的账单可以差两个数量级。但会员费是一样的。
火之前你不知道用户结构。火之后重度用户比例迅速攀升,账单追着服务器跑。这时候只有两个选择:
- 涨价、降上下文、加限流——被骂割韭菜
- 暂停新用户,先摸清老用户成本分布——也被骂,但可控
月之暗面选了第二个。从止损角度看,这是我能想到的更合理选项。
单位经济学四问自检
任何做 to C 大模型服务的团队,遇到"要不要限流"这类问题时,本质上是在回答四个具体问题。任何做 AI 产品的、做投研的、想自己搭 AI 应用的,都可以拿去照一下:
第一,用户消耗分布长什么样?
单用户日均 token 消耗的中位数、P95、P99 分别是多少?如果 P99 是中位数的 100 倍以上(不是 10 倍),说明服务被少数重度用户绑架了。他们吃掉的算力可能占集群三到五成,但付的钱和普通用户一样。
第二,推理引擎优化到什么程度?
单百万 output token 的推理成本,比同规模开源模型自建集群高多少?高 3 倍以内是架构可优化范围;高 5 倍以上,先别扩张用户,先修引擎。大厂能免费给用户用不是慈善,是他们的推理成本可能只有创业公司的三分之一。
第三,定价能不能覆盖长尾?
会员费能不能覆盖 P95 用户的实际成本?覆盖不了,就是在补贴长尾。补贴长尾不是道德问题,是账本问题——在拿融资烧一批注定不会转化的用户。
第四,免费用户的转化率是多少?
低于 5%,免费扩张接近纯烧钱。到 15%-20%,扩张才有意义。不做这一步测算就盲目铺量,跟当年 O2O 补贴打车没有区别。

换我来做,会做的三件事
如果我今天负责 Kimi 的产品,暂停开放期间会做三件很不性感、但很实在的事:
一是拉用户消耗分布图,把 P99 用户单独拎出来看——他们该不该走单独定价?Pro Max 档、企业档、按用量计费档,都可以谈。
二是上 request 级别的成本归因日志。让业务和研发面对同一份账单,而不是月末各自拿一份总数。工程师看不到自己写的代码要花多少钱,就永远优化不动。
三是重新算一次会员价,或者引入"基础包 + 超额用量单独计费"的混合模型。SaaS 行业二十年的老经验:面对长尾重度用户,纯订阅制都会演化成"订阅 + 用量"。AI 服务只是把这个演化压缩到两年内重演一遍。
一句收尾
用户看到的是"算力紧张"。工程师看到的是 KV cache 打满。财务看到的是单位毛利转负,融资在快速消耗。
三个说法讲同一件事。但只有第三个说法能解释:为什么问题不会随着新集群上线自动消失。
现在整个大模型 to C 行业最紧张的悬念,不是谁能训出最强模型,而是谁先算清楚一个用户到底该收多少钱。这一步没走完之前,K3、K4、K5 大概率还要再来一次"暂停会员开放"。