过去几年,AI公司吃了一顿全世界最大的免费自助餐。
互联网上所有的公开内容——新闻、小说、论文、百科、论坛帖子、摄影作品——被大规模抓取、喂进模型,训练出了ChatGPT、Claude这些产品。
而这些内容所真正创作者、拥有者,不知凡几,却没有收到一分钱,甚至都不知道自己的作品被用了。
这顿饭之所以能免费吃,是因为没人认真追究过。
现在有人追究了。

免费的代价
6月24日,近400家美国地方报纸联合起诉OpenAI和微软。这些可不都是纽约时报、华盛顿邮报这种有法务团队的大媒体,还有很多是报道本地新闻、法院审判、暴雨灾情的小报纸。
“我们花钱雇记者,记者跑去现场采访,写稿,编辑,公司承担法律风险。而AI公司把这些成果全部抓走,用聊天机器人的形式输出,连署名都去掉了。
OpenAI说他是「合理使用」——模型是在学习语言字符的统计规律,不是学习文章内容。
但Sam Altman自己都承认过:「领先的AI模型不可能不用版权材料来训练。」
各位看官注意了!这有逻辑漏洞:如果只是学规律,那用什么都行,根本不需要特定的版权内容吧?比如汉字形成的词语、成语完全能够穷举。
但奥特曼说的是「不可能不用」——那说明模型消化的是具体的、有版权保护的内容啊,不是什么抽象的统计规律。
而且OpenAI 可不止这一个苦主。纽约时报、韦氏词典、大英百科全书等公司都分别起诉了OpenAI,它现在最起码面临41起诉讼,总曝光超过30亿美元。(Anthropic今年也已经为了训练数据的问题付出了15亿美元以上的和解金了)
这这说明版权问题不是个别纠纷,是整个 AI行业都在被版权商清算。

免费午餐结束后,会怎样?
一个行业从「免费」走向「付费」,历史上发生过。
2000年代初,音乐产业被Napster和盗版几乎摧毁。然后iTunes出现了,再后来Spotify出现了。
音乐人从「作品被白嫖」变成了「按播放量收钱」。
整个行业的商业模式被重建了。
在我看来 AI训练数据也会走类似的路,甚至已经在路上了。
比如Getty Images上周宣布跟OpenAI达成了授权协议,股价一天暴涨123%。这说明在AI时代,有版权内容的公司不是贬值了,是在重新定价。

接下来可能会发生的事情:
大公司会建立授权体系。 OpenAI已经跟Getty、Shutterstock、美联社签了协议。以后「用数据先付费」也许会变成行业标准,就像唱片公司授权Spotify一样。
小公司和开源社区会被挤压。 然后授权费被整的非常高,只有大公司付得起。那当训练数据不再是公共资源,AI行业的准入门槛会大幅提高。
内容创作者会获得新的收入来源。 如果AI公司必须为训练数据付费,那些拥有大量高质量内容的媒体、出版商、摄影师、作家,可能会获得一笔以前不存在的收入。
「数据溯源」会变成基础设施。 以后AI生产内容可能需要明确标注「回答来源」 (其实现在已经有了雏形,绝大部分 AI 在依据网络检索之后会把信源也附上)。
这顿饭本来就该付钱
AI训练数据的免费午餐为什么能存在这么久?
因为互联网的默认规则是「可见=可用」。
在搜索引擎作为互联网流量入口的时候,它爬你的网页,给你带来流量,所以你默许了。
但AI公司爬你的网页,用你的内容训练模型,然后用模型生成的答案替代了你的原始内容——用户不需要再访问你的网站了。

这个循环跟搜索引擎完全不同。搜索引擎是「复制你的内容但把用户送回给你」,AI是「复制你的内容然后替代你」。
所以当内容创作者发现自己不是被「引用」而是被「替代」的时候,免费的默契就破裂了。
版权商们的起诉,不是在阻止技术进步。它们是在说:你用了我的东西,你就该付钱。
以上就是这次的侦察。
如果对你有用,顺手点个赞 +「♥️」。
想第一时间收到前线情报,关注「硅基斥候S01」。我们,下次侦察见。

