AI公司买完旧书训练就销毁,这到底合理吗?

导读最近看到一条新闻:多家AI公司在偷偷大量收购旧书,扫描训练完模型就直接销毁。

最近看到一条新闻:多家AI公司在偷偷大量收购旧书,扫描训练完模型就直接销毁。

很多人骂:这就是盗版!就是偷!太浪费了!

但如果你站在AI公司的角度算一笔账,会发现这其实是目前行业里最合理的选择。

你买旧书是买阅读权,AI买旧书是买原材料

很多人没转过这个弯:AI买旧书,和你去书店买旧书,根本不是一回事。

你买一本旧书,是为了阅读,看完书还是你的,可以摆书架,可以转卖。

AI买一本旧书,只是为了把书页上的文字提取出来。文字进了模型,纸就变成了没用的边角料,当然要处理掉。

这不叫浪费,这就是生产流程。就像你买钢材做零件,切完剩下的废料不可能一直留着。

为什么不找出版商要授权?太贵,太麻烦

有人说,为什么不走正规流程找出版商拿授权?

你替AI公司算算账:

  • 找出版商谈授权:一本畅销书授权费大几千到几万,小众书出版商根本懒得理你,谈下来的沟通成本比买书还贵。
  • 直接买二手书:一本几块到几十块,扫完拉倒,现货供应,流水线一天能扫几千本。

换你是CEO,你选哪个?

真不是AI公司想做坏人,是市场上现在根本就没有"批量卖训练数据授权"这个生意。出版商手里有几百万本旧书版权,但没人想着打包卖给AI公司。那AI公司只能自己想办法。

短期会成为常态,但长期一定会变

我觉得未来一两年,会有更多公司这么做——公开网页上的好内容挖得差不多了,旧书就是现成的高质量文本矿,成本还低。

但三五年之后,这个模式一定会变。

当所有人都来抢旧书,收购价格自然会涨。涨到一定程度,找出版商谈批量授权,反而比到处收书更划算。

那时候自然就会出新规则:出版商把旧书版权打包,按字数卖给AI公司,原作者分账。

这其实就是互联网走过的路:早年大家都在网上免费下音乐,等用户需求起来了,自然就长出了网易云音乐、QQ音乐这样的付费模式。

现在只是野蛮生长的阶段,需求先跑起来,规则慢慢跟上。

遇到AI版权争议,用这三个问题判断

我自己遇到这类AI版权争议,习惯用三个问题快速梳理清楚,分享给你:

AI版权争议三问自检清单

1. 这是把内容当"观点引用",还是当"生产原材料"? 2. 版权方有没有拿到和使用规模匹配的报酬? 3. 这种使用方式,会不会断掉创作者未来的生计?

这件事放到这个框架里看,就清楚了:

AI是把书当原材料用,原作者没拿到对应的报酬,长期来说确实不合理。但你也不能说它完全就是偷——它创造了新的价值,只是分配规则还没写好。

不用太早喊打喊杀。规则永远跟着产业走,产业起来了,规则自然会慢慢长出来。


AI训练数据的战争,才刚刚开始。