← 文章 / AI技术
The Verge 3小时前 · 2026-09-19 23:24:22 · 3 阅读

OpenAI 与微软内部文档:他们深知开启了损害网络的“末日循环”

近期,在《纽约时报》起诉 OpenAI 和微软一案中,解封的法院文件内容相当不利。这些公司的内部文档警告称,正在开启一个损害 Web 的“末日循环”;将其为训练模型而抓取数据的行为定性为“人类历史上最大规模的劳动盗窃”;并称此举“完全嘲弄了合理使用原则”。

文件中许多引人注目的引语来自微软应用科学总监 Brent Hecht。不过,微软试图与 Hecht 的这些言论划清界限。微软发言人 Alex Haurek 告诉 The Verge:“这些言论反映的是某一名员工的个人观点,并非法律分析,也不代表公司的立场。”

在另一份法庭文件中,微软 AI 数据战略与运营总经理 Jordan Usdan 将 Hecht 的角色描述为持对立观点。他称 Hecht“在 AI 数据生态系统应如何运作问题上持有不同、学术性及前瞻性的观点,并在微软任职以带来这种不对称、未来主义及学术视角……他也不是代表微软对其关于 AI 对内容创作者潜在影响之理论观点的发言人。”

但无论微软是否愿意认领这些言论,事实清楚地表明预测已成现实Google Zero 是真实存在的! AI 正在吞噬 Web!

在这份 92 页的《纽约时报》文件中,还有更多出人意料的言论,出自 Satya Nadella、Sam Altman 及其他 OpenAI 员工之口。以下是该文中的部分要点:

“一场惊人的盗窃”

该案涉及,正如微软应用科学总监Brent Hecht所述,'前所未有规模的惊人盗窃';SF1437,或许是'人类历史上最大规模的劳动窃取'。SF1652。被告未经许可,整篇复制原告数百万篇受版权保护的文章,以生产替代性商业AI产品。OpenAI的ChatGPT负责人写道,'出版商'面临这些产品带来的'生存威胁',SF1466,并表示这些产品'主要是替代性的,句号',而且'随着性能提升,替代性会越来越高'。SF1473-74。此类自认削弱了被告的'合理使用'抗辩,因为替代性是'版权法的死敌'。安迪·沃霍尔视觉艺术基金会诉戈德史密斯案,598 U.S.508, 528 (2023)。正如同一位微软高管所承认,被告若在此抗辩中胜诉,'恐怕会使

引言部分引用了Hecht和OpenAI ChatGPT负责人(推测为Nick Turley)的话,似乎在表明这些公司明知它们对《纽约时报》等出版商构成了"生存威胁"。Hecht称ChatGPT和Copilot的数据采集行为是"人类历史上最大规模的劳动窃取",并表示微软的抗辩使"合理使用"的概念"彻底沦为笑柄"。

这是一个"末路循环"

微软 CEO Satya Nadella 在宣誓作证时承认,与聊天机器人对话“已经取代了……直接在 AI 平台上获取信息,而不必再去访问原始来源”。SF1432。一份微软内部文件承认,在这场博弈中没有人是赢家:“我们的 AI 内容战略已经开启了一个‘末日循环’,会同时损害我们模型和整个互联网的表现:终端产品威胁到其核心供应商的经济根基,这种情况极为罕见,但这就是我们的 LLM 业务在‘内容供应链’上所面临的处境。”

Satya Nadella 承认,聊天机器人已经基本取代了搜索,用户不再需要亲自访问原始信息来源。但更具杀伤力的,是一份微软内部文件中的表述:“我们的 AI 内容战略已经开启了一个‘末日循环’,会同时损害我们模型和整个互联网的表现:终端产品威胁到其核心供应商的经济根基,这种情况极为罕见,但这就是我们的 LLM 业务在‘内容供应链’上所面临的处境。”

这数字根本不靠谱

差不多同一时期,OpenAI 联合创始人 Greg Brockman 写道,商业化 OpenAI 的技术能带来的“天文数字”财富令他“深受激励”。SF630。最近有报道称,OpenAI 正计划以 1 万亿美元估值进行 IPO。

别被 OpenAI 或微软标榜的利他主义迷惑了。OpenAI 联合创始人 Greg Brockman 真正在乎的,是商业 AI 可能带来的“天文数字”般的财富。

付费墙?去它的付费墙

OpenAI 和微软内部人员无视绕过付费墙和违反使用条款等数据获取问题。SF521-47, 790-92。例如,OpenAI 的公司代表作证称,他并不知道公司“在训练数据集中检测付费内容”或“从训练数据集中删除付费内容”有任何举措。

尽管纳德拉随后表示“所有受付费墙保护的内容都应获得授权”,但 OpenAI 的一位代表承认,他“并不知情”公司是否采取了任何措施来检测或从训练数据中移除付费内容。

“疯狂擅长复述”

同年,OpenAI 意识到其 API “可能会逐字输出已有内容。” SF945。到 2021 年,OpenAI 认为防止记忆对于“符合合理使用原则 [合规] 以及减少模型输出中的版权侵犯”很重要。SF946。2022 年 6 月,OpenAI 员工承认,GPT-4 将“记忆了大量数据,因此会疯狂擅长复述。”

从内部情况看,OpenAI 似乎很清楚 ChatGPT 倾向于直接逐字复制受版权保护材料。尽管他们承认“防止记忆”对于“最小化版权侵犯”很重要,但员工们承认 GPT-4“记忆了大量数据,因此会疯狂擅长复述”。

随后,该文件列举了几个实例,显示在回应查询时,ChatGPT 直接输出了来自《泰晤士报》、《水银新闻》、《丹佛邮报》、《LifeHacker》和《Eurogamer》文章的长篇复制内容。

“‘吞噬’了它们的所有作品”

正如微软所承认的:“全世界数百万人很快会将大模型‘吞噬’他们所有工作视为一场史无前例的惊人窃取”,并承认“几乎没有人希望以这种方式使用他们创建的内容,他们也没有因此获得补偿。”

微软很清楚其大规模抓取互联网的行为会被如何看待,并承认“几乎没有人希望以这种方式使用他们(原文如此,they [sic])创建的内容,也没有人为此获得补偿。”

“人类劳动的替代品”

OpenAI 政策主管 Jack Clark 也写道:“[我们]在 AI 与创造力领域的工作将越来越多地导向创建取代定义社会‘文化’之人们劳动的系统[。]” SF1677。OpenAI 内部文件将 ChatGPT 描述为“[现]代报刊亭”,SF1500,并夸耀 ChatGPT 提供“快速、及时的回答……这些原本需要你去搜索引擎查找的内容”,包括“最新的体育比分、新闻、股票报价等。”

OpenAI 政策主管 Jack Clark 敏锐地意识到危机将至,表示他们正在“创建取代那些定义社会‘文化’的人们的劳动的系统”。内部文件将 ChatGPT 描述为“现代报刊亭”。OpenAI 的 Nick Turley 后来引用称,一旦从聊天机器人那里得到答案,就“没有理由去点击”链接查看来源。

摧毁自身供应链

Defendants acknowledge the predictable consequences of this design. Per Microsoft, the“[p]romise of LLMs is largely in the same information work domains from which they get theircontent... They naturally compete with their content supply chain.” SF1798. They substitute forthe “labor of the people” who produced the original content on which they were trained, including,among other things, newspapers and books. SF1452, 1677. There is a “real risk” that GenAI could“significantly disrupt[] the employment of the very people who generated the data on which thefoundation model was trained.” SF1467. “LLMs are a product that destroys its supply chain.”

微软被引述承认“LLM 是一种会摧毁自身供应链的产品”,因为在很多情况下,它直接替代了自己的训练数据来源。

OpenAI 明知自己在杀死导流流量

OpenAI 的另一位经济领域专家 Goldfarb 博士发表意见称:“我观察到,指向《泰晤士报》旗下资产的推荐流量下降,是由包括‘例如 Google AI Overviews’在内的多种因素共同作用的结果。”SF1784, 1786. Goldfarb 博士还就 DNP 案表示,“Google 推出的 AI overviews 可能使搜索推荐流量下降了 20% 至 60%”。SF1785. OpenAI 的媒体专家 Sinnreich 博士基于 2026 年路透社研究所的分析指出,“自 Google 引入 AI overviews 以来,从 Google 搜索和 Google Discover 流向出版商的推荐流量已大幅缩水(Discover 渠道的月推荐量从超过 50 亿次降至不到 40 亿次,搜索渠道则从远超 30 亿次降至略高于 20 亿次)”。SF1787. Sinnreich 博士也承认,Google 推荐流量的下降与 AI 生成的摘要等因素有关。

OpenAI 自家的媒体和经济学专家直接将《泰晤士报》等网站推荐流量下降归因于 Google AI Overviews 这类 AI 摘要。他们推测,搜索推荐流量可能下滑了高达 60%。

微软发言人 Haurek 提醒道:“Satya 的证词与微软在此案中的立场完全一致。他阐述的是人们在查找和消费信息的方式上正在发生的广泛原则性变化。这些观察不应与法院面前待决的版权问题结论相混淆,微软已在其提交的文件中对此予以回应。”

但根据这份新解封的文件,情况似乎很明确:微软和 OpenAI 深知自己将对出版行业及其雇用的“数百万人”造成不可挽回的伤害,进而也会损害自家产品,但仍为追求“数十亿美元”的收益而一意孤行——哪怕这意味着要陷入死亡循环也无所谓。

原始来源: The Verge

评论 (0)