《纽约时报》起诉 OpenAI 和微软的版权案,近日披露了更多未删节材料。新文件显示,两家公司内部曾多次讨论,AI 训练对新闻内容的依赖,可能直接冲击出版商的流量、收入和就业基础。
内部文件提到“盗窃”
根据诉讼文件,微软一名高管曾私下把 AI 抓取描述为“盗窃”。另一份 2023 年 1 月的内部备忘录中,微软应用科学总监 Brent Hecht 还将其称为“史无前例的惊人盗窃”,并写下“人类历史上最大规模的劳动盗窃”这一表述。
文件还显示,OpenAI 内部也讨论过类似风险。负责 ChatGPT 的 Nick Turley 在内部沟通中称,聊天机器人类产品对出版商构成“生存威胁”,而且随着模型能力增强,这种替代性会越来越强。
新闻网站流量受压
诉讼材料称,微软自己的数据表明,Copilot 的“答案引擎”让用户更少点击原始新闻网站。与传统 Bing 搜索相比,流向《纽约时报》域名的点击率最高下降 93%。
Hecht 在 2024 年 1 月的一份内部演示文稿中,把这种趋势称为“末日循环”。文件称,如果内容提供方的商业基础被削弱,模型本身和整个网络生态都会受到拖累。
微软 CEO 纳德拉今年在证词中也表示,凡是设有付费墙的内容,任何希望将其用于训练或检索增强的人都应取得授权。他还称,如果自己当时知道 OpenAI 抓取了付费墙后的内容用于训练,微软本可以要求 OpenAI 重新训练模型。
抓取方式与数据规模曝光
新披露材料还描述了两家公司如何获取新闻内容。诉讼称,OpenAI 和微软通过大规模抓取建立训练数据集,其中部分内容来自 Bing 索引,也包括大量来自 Common Crawl 的网页数据。
- 中期训练数据含逾 91,692 份新闻作品副本
- nytimes.com 在一组数据中超 200 万份文档
- Project Mango 含至少 160,903 篇独立作品副本
文件还指控,OpenAI 员工曾讨论如何在不被发现的情况下绕过《纽约时报》付费墙,并在训练前移除版权声明,以避免模型向用户输出相关版权信息。
补充信息:目前部分底层证据仍处于封存状态,这次公开的新增内容主要来自《纽约时报》提交的法庭文件;OpenAI 和微软均未回应 TechCrunch 的置评请求。










