Kimi 跑分超过 Claude,大模型格局真的变了吗?

导读前阵子和几家大模型厂商朋友聊天,聊到这次 Kimi K3 跑分超过 Claude,我最大的感受是:

前阵子和几家大模型厂商朋友聊天,聊到这次 Kimi K3 跑分超过 Claude,我最大的感受是:

跑分早就不是媒体评奖的游戏了,它已经变成了真刀真枪的竞争武器。

两年前,没人敢想这一天

放在两年前,你说国内大模型跑分能超过 Claude,九成九的人会觉得你在吹牛。

那时候行业是什么样?

  • 大家聊天开口就是"OpenAI 怎样怎样",“Anthropic 技术积累多强”
  • 国内厂商能做到"不犯低级错误"就算及格,没人敢跟第一梯队比基础能力

现在 Kimi 把这个结果摆出来,其实就是捅破了一层窗户纸:

国内大模型在基础能力上,真的追平了。

我身边不少做AI应用的创业者,已经开始悄悄切换模型了。

不是 Claude 不好用,是一笔账算得清清楚楚:

  • 同样十万字上下文,国内模型推理成本是 Claude 的 1/3 甚至更低
  • 基础能力跑分已经差不了多少,日常需求完全能覆盖

对创业者来说,这哪里是选择题,这就是数学题。

但跑分登顶,不等于颠覆格局

不过你要问我,这是不是意味着 Kimi 立刻就能抢走 Claude 一半市场,我觉得也太快了。

我听过一个很实在的对比:

  • 处理十万字以上的超长文档,复杂表格、乱格式混在一起,Claude 的出错率现在还是更低,稳定性更好
  • 但如果只是处理三五万字的日常需求,K3 完全够用,价格还便宜一半

这其实就是当前大模型市场的真实样子:

第一梯队的门槛,早就变了。

从前门槛是"你能不能做出一个大模型",现在门槛是"你能不能把推理成本降下来"。

单纯比参数、比跑分的时代过去了。接下来比的不是谁的数字好看,是谁更懂用户场景。

我去年认识一个做企业知识库的创始人,他给我算过一笔账:

  • 一开始全量用 Claude,一个月推理费用十几万
  • 后来把大部分请求切到国内模型,只把最复杂的交给 Claude
  • 总成本直接降了 70%,用户完全没感觉到差别

这种事,接下来会越来越多。

大模型开发者选择对比

真正的变化是什么?

这次 Kimi 跑分登顶,最大的意义根本不是"谁当第一"。

它是告诉整个行业:原来第一梯队的席位,不是欧美厂商锁死的。后来者踏踏实实堆工程、堆数据,真的能冲上来。

接下来两三年,行业会变成什么样?

  • 国内大模型会从"跟跑"正式进入"并列跑"
  • 价格战会比大家预想的更激烈
  • 最终受益的是开发者,还有我们这些普通用户

毕竟对大多数人来说,不需要谁是宇宙第一,只需要:

能用,够用,便宜够用。

跑分给了你入场券,但能不能留住用户,最后还是要看谁能把价格打下来,把场景做深。