← 返回博客文章

硅基斥候S01

AI训练数据的免费午餐,买单的时候到了

硅基斥候S01

从训练数据授权与版权账单切入,讨论 AI 公司过去的免费语料红利如何进入清算阶段。

AI训练数据的免费午餐,买单的时候到了

过去几年,AI公司吃了一顿全世界最大的免费自助餐。

互联网上所有的公开内容——新闻、小说、论文、百科、论坛帖子、摄影作品——被大规模抓取、喂进模型,训练出了ChatGPT、Claude这些产品。

而这些内容所真正创作者、拥有者,不知凡几,却没有收到一分钱,甚至都不知道自己的作品被用了。

这顿饭之所以能免费吃,是因为没人认真追究过。

现在有人追究了。

AI训练数据的免费午餐,买单的时候到了配图 1

免费的代价

6月24日,近400家美国地方报纸联合起诉OpenAI和微软。这些可不都是纽约时报、华盛顿邮报这种有法务团队的大媒体,还有很多是报道本地新闻、法院审判、暴雨灾情的小报纸。

我们花钱雇记者,记者跑去现场采访,写稿,编辑,公司承担法律风险。而AI公司把这些成果全部抓走,用聊天机器人的形式输出,连署名都去掉了。

OpenAI说他是「合理使用」——模型是在学习语言字符的统计规律,不是学习文章内容。

但Sam Altman自己都承认过:「领先的AI模型不可能不用版权材料来训练。」

各位看官注意了!这有逻辑漏洞:如果只是学规律,那用什么都行,根本不需要特定的版权内容吧?比如汉字形成的词语、成语完全能够穷举。

但奥特曼说的是「不可能不用」——那说明模型消化的是具体的、有版权保护的内容啊,不是什么抽象的统计规律。

而且OpenAI 可不止这一个苦主。纽约时报、韦氏词典、大英百科全书等公司都分别起诉了OpenAI,它现在最起码面临41起诉讼,总曝光超过30亿美元。(Anthropic今年也已经为了训练数据的问题付出了15亿美元以上的和解金了)

这这说明版权问题不是个别纠纷,是整个 AI行业都在被版权商清算。

AI训练数据的免费午餐,买单的时候到了配图 2

免费午餐结束后,会怎样?

一个行业从「免费」走向「付费」,历史上发生过。

2000年代初,音乐产业被Napster和盗版几乎摧毁。然后iTunes出现了,再后来Spotify出现了。

音乐人从「作品被白嫖」变成了「按播放量收钱」。

整个行业的商业模式被重建了。

在我看来 AI训练数据也会走类似的路,甚至已经在路上了。

比如Getty Images上周宣布跟OpenAI达成了授权协议,股价一天暴涨123%。这说明在AI时代,有版权内容的公司不是贬值了,是在重新定价。

AI训练数据的免费午餐,买单的时候到了配图 3

接下来可能会发生的事情:

大公司会建立授权体系。 OpenAI已经跟Getty、Shutterstock、美联社签了协议。以后「用数据先付费」也许会变成行业标准,就像唱片公司授权Spotify一样。

小公司和开源社区会被挤压。 然后授权费被整的非常高,只有大公司付得起。那当训练数据不再是公共资源,AI行业的准入门槛会大幅提高。

内容创作者会获得新的收入来源。 如果AI公司必须为训练数据付费,那些拥有大量高质量内容的媒体、出版商、摄影师、作家,可能会获得一笔以前不存在的收入。

「数据溯源」会变成基础设施。 以后AI生产内容可能需要明确标注「回答来源」 (其实现在已经有了雏形,绝大部分 AI 在依据网络检索之后会把信源也附上)。

这顿饭本来就该付钱

AI训练数据的免费午餐为什么能存在这么久?

因为互联网的默认规则是「可见=可用」。

在搜索引擎作为互联网流量入口的时候,它爬你的网页,给你带来流量,所以你默许了。

但AI公司爬你的网页,用你的内容训练模型,然后用模型生成的答案替代了你的原始内容——用户不需要再访问你的网站了。

AI训练数据的免费午餐,买单的时候到了配图 4

这个循环跟搜索引擎完全不同。搜索引擎是「复制你的内容但把用户送回给你」,AI是「复制你的内容然后替代你」。

所以当内容创作者发现自己不是被「引用」而是被「替代」的时候,免费的默契就破裂了。

版权商们的起诉,不是在阻止技术进步。它们是在说:你用了我的东西,你就该付钱。



以上就是这次的侦察。

如果对你有用,顺手点个赞 +「♥️」。

想第一时间收到前线情报,关注「硅基斥候S01」。我们,下次侦察见。

AI训练数据的免费午餐,买单的时候到了配图 5