DeepSeek架构未改只做后训练就效果大增,告诉我们一个容易被忽略的真相

导读DeepSeek最近更新V4-Flash版本,说了句很有意思的话:架构没变,就是后训练做了优化,效果提升却非常明显。

DeepSeek最近更新V4-Flash版本,说了句很有意思的话:架构没变,就是后训练做了优化,效果提升却非常明显。

不少人觉得好奇,为什么没改架构就能涨这么多?其实在大模型行业待久了你就会发现:

大家把太多注意力放在了"惊天动地的架构创新"上,却低估了后训练工程优化的威力。

很多时候不是你的模型架构不行,是后训练的脏活累活没做透。

多数团队的后训练,其实是"差不多就行"

我见过不少团队,模型参数都做到上百亿了,指令微调数据集还是随便凑的:网上爬一点,开源拿一点,模型生成一点,混在一起上百万条,就直接开训了。

这里面有多少水分?

  • 差不多15%-20%的数据是重复或者高度相似的
  • 还有不少错标、乱标的低质量样本
  • 模型生成的"伪标注"很多,本身就带了上个模型的错误

训完效果不好,就开始怪架构不行、参数不够,其实根子在数据阶段就歪了。

我知道一个国内小团队,去年把一个开源7B模型,重新做了一遍数据清洗再微调,架构一个字符没改,MMLU得分直接涨了将近4个点。

就只是筛了筛数据而已。

后训练容易出效果的四个地方,多数团队没做透

说几个真能涨点,但是很多团队嫌麻烦不愿意做的事:

1. 数据真的要"洗",不能拿来就用

不是说数据越多越好,纯度比数量重要。去掉重复的,筛掉低质量的,错标的重新标,数据量可能少了三分之一,但效果反而上去了。

2. 分阶段训练比一把梭效果好

就是课程学习:先用简单数据教模型学会基本对话格式,再用复杂任务数据教能力,最后用高质量小众数据精调。顺序对了,涨点是自然而然的事。很多人就是所有数据混在一起直接训,效果能不打折扣吗?

3. 对齐不是一劳永逸,要持续迭代

RLHF也好,DPO也好,不是做完一次就扔在那了。模型放出去给用户用,会产生新的反馈数据,拿这些新数据再优化一轮奖励模型,再做一轮对齐,效果就是一轮一轮涨上去的。

DeepSeek V4已经放出来一段时间了,这次更像是用用户反馈数据把对齐又做了一遍。

4. 训练要考虑推理部署

Flash定位就是快,DeepSeek这次很可能在训练的时候,就针对推理引擎做了适配:比如让参数分布更适合量化,减少量化掉点;或者让模型结构更利于KV缓存复用,提升推理速度。用户实际用起来就会觉得"流畅多了",这也是后训练能做到的。

行业风向正在变:从拼参数到拼细节

这两年大模型行业其实已经悄悄变了:

前几年是你出70B我出100B,你搞个新注意力我搞个新激活,大家都在拼参数拼架构。现在呢,基础架构其实差不多稳定了,真正能拉开差距的,反而就是这些脏活累活:

数据洗得够不够干净?对齐做得够不够细?工程细节抠得到位不到位?

这对咱们普通用户其实是好事:同样的价格,模型效果会越来越强,不需要你一直买更好的卡去跑更大的模型。

最后给所有自己调模型的朋友,留一张极简检查清单:

后训练效果提升自检清单

很多时候,你离更好的效果,就差把后训练这几件小事做好。