OpenAI 与微软内部文档:他们深知开启了损害网络的“末日循环”
近期,在《纽约时报》起诉 OpenAI 和微软一案中,解封的法院文件内容相当不利。这些公司的内部文档警告称,正在开启一个损害 Web 的“末日循环”;将其为训练模型而抓取数据的行为定性为“人类历史上最大规模的劳动盗窃”;并称此举“完全嘲弄了合理使用原则”。
文件中许多引人注目的引语来自微软应用科学总监 Brent Hecht。不过,微软试图与 Hecht 的这些言论划清界限。微软发言人 Alex Haurek 告诉 The Verge:“这些言论反映的是某一名员工的个人观点,并非法律分析,也不代表公司的立场。”
在另一份法庭文件中,微软 AI 数据战略与运营总经理 Jordan Usdan 将 Hecht 的角色描述为持对立观点。他称 Hecht“在 AI 数据生态系统应如何运作问题上持有不同、学术性及前瞻性的观点,并在微软任职以带来这种不对称、未来主义及学术视角……他也不是代表微软对其关于 AI 对内容创作者潜在影响之理论观点的发言人。”
但无论微软是否愿意认领这些言论,事实清楚地表明预测已成现实。Google Zero 是真实存在的! AI 正在吞噬 Web!
在这份 92 页的《纽约时报》文件中,还有更多出人意料的言论,出自 Satya Nadella、Sam Altman 及其他 OpenAI 员工之口。以下是该文中的部分要点:
“一场惊人的盗窃”
引言部分引用了Hecht和OpenAI ChatGPT负责人(推测为Nick Turley)的话,似乎在表明这些公司明知它们对《纽约时报》等出版商构成了"生存威胁"。Hecht称ChatGPT和Copilot的数据采集行为是"人类历史上最大规模的劳动窃取",并表示微软的抗辩使"合理使用"的概念"彻底沦为笑柄"。
这是一个"末路循环"

Satya Nadella 承认,聊天机器人已经基本取代了搜索,用户不再需要亲自访问原始信息来源。但更具杀伤力的,是一份微软内部文件中的表述:“我们的 AI 内容战略已经开启了一个‘末日循环’,会同时损害我们模型和整个互联网的表现:终端产品威胁到其核心供应商的经济根基,这种情况极为罕见,但这就是我们的 LLM 业务在‘内容供应链’上所面临的处境。”
这数字根本不靠谱

别被 OpenAI 或微软标榜的利他主义迷惑了。OpenAI 联合创始人 Greg Brockman 真正在乎的,是商业 AI 可能带来的“天文数字”般的财富。
付费墙?去它的付费墙
尽管纳德拉随后表示“所有受付费墙保护的内容都应获得授权”,但 OpenAI 的一位代表承认,他“并不知情”公司是否采取了任何措施来检测或从训练数据中移除付费内容。
“疯狂擅长复述”
从内部情况看,OpenAI 似乎很清楚 ChatGPT 倾向于直接逐字复制受版权保护材料。尽管他们承认“防止记忆”对于“最小化版权侵犯”很重要,但员工们承认 GPT-4“记忆了大量数据,因此会疯狂擅长复述”。
随后,该文件列举了几个实例,显示在回应查询时,ChatGPT 直接输出了来自《泰晤士报》、《水银新闻》、《丹佛邮报》、《LifeHacker》和《Eurogamer》文章的长篇复制内容。
“‘吞噬’了它们的所有作品”

微软很清楚其大规模抓取互联网的行为会被如何看待,并承认“几乎没有人希望以这种方式使用他们(原文如此,they [sic])创建的内容,也没有人为此获得补偿。”
“人类劳动的替代品”
![OpenAI 政策主管 Jack Clark 也写道:“[我们]在 AI 与创造力领域的工作将越来越多地导向创建取代定义社会‘文化’之人们劳动的系统[。]” SF1677。OpenAI 内部文件将 ChatGPT 描述为“[现]代报刊亭”,SF1500,并夸耀 ChatGPT 提供“快速、及时的回答……这些原本需要你去搜索引擎查找的内容”,包括“最新的体育比分、新闻、股票报价等。”](https://dbyun-product.oss-cn-chengdu.aliyuncs.com/crawl/b5daea9851c7ab9e902872e8e0b253e5.png)
OpenAI 政策主管 Jack Clark 敏锐地意识到危机将至,表示他们正在“创建取代那些定义社会‘文化’的人们的劳动的系统”。内部文件将 ChatGPT 描述为“现代报刊亭”。OpenAI 的 Nick Turley 后来引用称,一旦从聊天机器人那里得到答案,就“没有理由去点击”链接查看来源。
摧毁自身供应链
![Defendants acknowledge the predictable consequences of this design. Per Microsoft, the“[p]romise of LLMs is largely in the same information work domains from which they get theircontent... They naturally compete with their content supply chain.” SF1798. They substitute forthe “labor of the people” who produced the original content on which they were trained, including,among other things, newspapers and books. SF1452, 1677. There is a “real risk” that GenAI could“significantly disrupt[] the employment of the very people who generated the data on which thefoundation model was trained.” SF1467. “LLMs are a product that destroys its supply chain.”](https://dbyun-product.oss-cn-chengdu.aliyuncs.com/crawl/2d4687446855e0624580adc37ba110a3.png)
微软被引述承认“LLM 是一种会摧毁自身供应链的产品”,因为在很多情况下,它直接替代了自己的训练数据来源。
OpenAI 明知自己在杀死导流流量

OpenAI 自家的媒体和经济学专家直接将《泰晤士报》等网站推荐流量下降归因于 Google AI Overviews 这类 AI 摘要。他们推测,搜索推荐流量可能下滑了高达 60%。
微软发言人 Haurek 提醒道:“Satya 的证词与微软在此案中的立场完全一致。他阐述的是人们在查找和消费信息的方式上正在发生的广泛原则性变化。这些观察不应与法院面前待决的版权问题结论相混淆,微软已在其提交的文件中对此予以回应。”
但根据这份新解封的文件,情况似乎很明确:微软和 OpenAI 深知自己将对出版行业及其雇用的“数百万人”造成不可挽回的伤害,进而也会损害自家产品,但仍为追求“数十亿美元”的收益而一意孤行——哪怕这意味着要陷入死亡循环也无所谓。