陈Alan AI与数据合规 5小时前 · 2026-10-04 00:16:30 · 9 阅读
AI训练上诉首案:大模型喜忧参半
2026年9月,美国第三巡回上诉法院对 Thomson Reuters Enterprise Centre GmbH v. ROSS Intelligence Inc. 作出判决,维持特拉华州联邦地区法院此前的部分简易判决:ROSS使用Westlaw的判例要旨制作训练数据、训练AI法律检索产品,不构成合理使用。这是美国联邦上诉法院第一次正面处理AI语境下的版权合理使用问题。看到这里,很容易把这份判决概括成一句话:“美国AI版权上诉首案认定,拿版权作品训练AI不属于合理使用。”但这并不是第三巡回法院真正说的话。法院在判ROSS败诉的同时,反而专门解释了为什么ROSS与OpenAI、Anthropic所代表的生成式大模型不同:ROSS不能生成新的表达,而且训练出来的产品就是Westlaw的直接竞争对手。所以,ROSS输了,并不等于OpenAI也会输。不过,大模型公司也不能因此松一口气。因为同一份判决的另一部分,可能比ROSS败诉本身更值得关注:第三巡回法院明确承认,将版权内容授权用于AI训练,可以构成一个正在发展的潜在市场。这份美国AI版权上诉首案,因此同时留下了两个问题。ROSS为什么输?以及,为什么它输了以后,通用大模型的版权战争反而变得更复杂了?
一、ROSS为什么会输?
要理解这份判决,首先要弄清楚ROSS到底用了什么。Westlaw是美国最重要的法律数据库之一。美国法院作出的司法判决本身不受版权保护,原则上任何人都可以收集和使用。因此,Thomson Reuters并不能因为ROSS使用美国司法判决,就主张版权侵权。本案真正发生争议的,是Westlaw对这些判决进行编辑加工后形成的headnotes,本文译作“判例要旨”。Westlaw编辑会阅读司法判决,从中识别值得关注的法律问题,再将有关内容提炼成简短的判例要旨,并对应到判决中的具体段落。司法判决本身是公共法律材料,但判例要旨包含了编辑关于“什么值得提炼、哪些事实需要保留、如何重新表达法律规则”的判断。ROSS曾经提出,法律规则本身不能被版权垄断;如果表达一种法律规则的方法十分有限,思想与表达可能发生“合并”,有关内容不应再受到版权保护。第三巡回法院的回应非常简洁:“Headnotes are not law; judicial opinions are.”“判例要旨不是法律;司法判决才是法律。”同一个法律问题完全可以用不同方式概括。保护Westlaw编辑形成的具体表达,并不会让Thomson Reuters取得对法律规则本身的垄断。法院因此确认,本案涉及的2,243条判例要旨具有版权保护所要求的原创性。接下来的问题,是ROSS如何使用这些内容。ROSS Intelligence是一家AI法律科技创业公司。它希望让律师不再依赖复杂的关键词和布尔检索式,而是可以直接用自然语言提出法律问题,再由AI从大约一千万份司法判决中寻找最相关的段落。这里有一个理解整个案件的关键:ROSS不是ChatGPT。它不会根据用户的问题生成一段新的法律分析,而是寻找、排序并返回已有司法判决中的相关内容。从产品形态上看,它更接近一个利用AI改进搜索能力的法律检索产品,而不是今天我们熟悉的通用生成式大模型。而且,ROSS从一开始就是奔着Westlaw去的。判决记载,ROSS曾经直接将自己的产品与Westlaw比较,其商业目标之一就是成为Westlaw的替代产品,也确实存在律师事务所从Westlaw转向ROSS的情况。训练数据的问题也出在这里。为了让模型知道“什么法律问题对应什么司法判决”,ROSS委托LegalEase Solutions制作大约25,000份训练材料。每份材料包含一个法律问题和若干判决段落,再分别标记这些段落与问题的相关程度。如果完全从零开始制作这些数据,LegalEase需要自己阅读大量司法判决,再从中提炼数万个法律问题。但Westlaw已经花费大量人工成本做过非常类似的事情。于是,LegalEase参考Westlaw的判例要旨,将其改写成训练所需的法律问题,再把对应的司法判决段落作为答案。整个过程大致是:Westlaw编辑阅读判决并提炼判例要旨,LegalEase参考这些判例要旨制作问题,再配上司法判决原文形成训练数据,最后用于训练ROSS。这个事实后来对合理使用分析非常不利。ROSS本来就拥有大约一千万份不受版权保护的司法判决。它并不是没有合法材料可以用,只是如果完全依靠这些判决自行制作训练数据,需要投入更多时间和成本。Westlaw已经整理好的判例要旨,提供了一条更加方便的捷径。而第三巡回法院并不认为,“拿来训练AI”就足以改变这一点。美国版权法判断合理使用,需要综合考虑四项因素:使用的目的和性质、版权作品的性质、使用部分的数量和实质性,以及这种使用对作品现有或者潜在市场的影响。本案中,只有第二项“版权作品的性质”有利于ROSS;判例要旨主要是对事实和法律规则的总结,而且已经公开发表,属于版权保护相对较弱的一类作品。真正决定案件走向的,是其他几个因素。ROSS一个很重要的理由是,它并没有把Westlaw判例要旨直接展示给用户。判例要旨进入训练流程以后,用户最终看到的仍然是司法判决,而不是Thomson Reuters的文字。法院也承认,ROSS确实增加了一个训练环节:“ROSS took an intermediate step of using the headnotes to train an AI program.”“ROSS增加了一个使用判例要旨训练AI程序的中间步骤。”但法院没有因为作品中间经过了“AI训练”,就认定使用目的自然发生了转换。它继续追问的是:这个AI最后是干什么的?Thomson Reuters利用判例要旨帮助律师进行法律研究;ROSS使用这些判例要旨训练出来的产品,同样帮助律师进行法律研究,而且希望成为Westlaw的替代品。法院因此认为,两者都在利用有关内容“create and optimize a legal-research platform”,也就是创建和优化法律研究平台,ROSS的使用至多只具有较低程度的转换性。这个判断很值得记住。“训练AI”本身不是版权法上的魔法词。作品进入训练流程,不会因为最后变成模型参数,就自动完成一次版权法意义上的“转换”。法院仍然可以继续追问:为什么需要这些作品?模型训练以后提供什么功能?新的产品与原作品或者权利人的产品之间是什么关系?它是不是正在替代权利人的市场?进入模型参数,并不是版权法上的洗衣机。ROSS在使用数量上的抗辩同样没有成功。它提出,Westlaw拥有大约2,800万条判例要旨,而自己涉及的内容仅占约0.08%,比例非常小。法院认为,这个算法的问题在于分母选错了。每一条判例要旨本身都可以是一部独立的版权作品。因此,对于每一条被使用的判例要旨而言,ROSS复制的不是0.08%,而是一整部作品。法院说:“So for each headnote taken, ROSS copied an entire work.”“因此,对于每一条被使用的判例要旨,ROSS复制的都是一部完整作品。”更麻烦的是,这种复制并非训练ROSS所必需。ROSS手里本来就有约一千万份可以自由使用的司法判决,完全可以自行阅读、提出法律问题并制作训练材料。使用Westlaw判例要旨,最大的价值在于省事。法院对此留下了一句很适合AI训练案件的话:“Unlike necessity, ease is not a justification for copying.”“便利不同于必要;方便并不能成为复制的正当理由。”至少在ROSS的事实下,“自己制作训练数据太贵,别人已经整理好了,直接拿来训练更加方便”,显然不是法院愿意接受的合理使用理由。ROSS之所以输,并不是因为法院认为“凡是训练AI都必须取得许可”,而是因为这组事实对它实在不利:它使用竞争对手人工整理形成的版权内容,明明拥有大量可以自由使用的原始材料,却为了降低训练成本走了捷径;训练出来的仍然是法律检索产品,而且准备直接和Westlaw竞争。问题也因此来到下一层。如果换成OpenAI或者Anthropic,结论还会一样吗?二、为什么ROSS输了,不等于OpenAI也会输?
这可能是整份判决最容易被忽略、却对通用大模型最重要的部分。第三巡回法院完全可以只讨论ROSS,然后结束案件。但它没有这么做。法院主动讨论了美国司法部在 In re OpenAI Copyright Litigation 中提出的意见,也提到了此前备受关注的 Bartz v. Anthropic。美国司法部援引Bartz案主张,训练一个能够产生原创回答的大语言模型,可能具有与原作品不同的使用目的,因此可以支持转换性使用的认定。第三巡回法院没有否定这一观点。相反,它明确表示:“The concerns raised in that separate case do not apply here.”“另案中提出的这些问题并不适用于本案。”原因之一,是ROSS和今天的生成式大模型根本不是同一种产品。法院指出:“Unlike the AI models in Bartz and In re: OpenAI, ROSS’s AI platform cannot generate original expression.”“与Bartz案和OpenAI案中的AI模型不同,ROSS的AI平台不能生成原创表达。”这一句话非常重要。法院并没有说,只要模型能够生成新的表达,训练行为就当然属于合理使用。但它至少明确认为,“训练以后能否产生新的表达”是区分ROSS与通用大模型的一个重要事实。还有另一个区别,就是替代性竞争。ROSS训练AI的目的,就是开发一个与Westlaw竞争的法律检索产品。对于用户而言,两者解决的是非常接近的问题,甚至可以直接互相替代。而在OpenAI、Anthropic等案件中,一个能够写作、编程、翻译、总结和进行多种推理任务的通用大模型,与其训练时使用的某一本书、某篇新闻报道或者某张图片之间,是否存在同样程度的直接替代关系,并不能当然得出与ROSS相同的结论。所以,第三巡回法院实际上划出了两条值得继续观察的线。第一,模型训练以后是否能够产生新的表达;第二,模型训练以后形成的产品,是否直接替代权利人的作品或者产品。这也是为什么,把ROSS判决概括成“美国联邦上诉法院首次认定AI训练不属于合理使用”,并不准确。法院真正说的是:在ROSS这样的事实下,合理使用不能成立。而ROSS这样的事实相当特殊。它使用竞争对手人工编辑形成的版权内容,训练出来的仍然是同一种法律检索产品;它不能生成新的表达,而且最终目标就是成为Westlaw的直接替代品。这与利用海量、多来源语料训练一个能够写作、编程、翻译、总结和推理的通用大模型,并不是完全相同的版权问题。OpenAI当然不能因为这一段就宣布安全。第三巡回法院没有判断OpenAI的训练行为属于合理使用,更没有为生成式AI建立一个新的豁免。它只是明确告诉未来的法院:ROSS为什么败诉,并不能简单复制到所有AI训练案件中。这一点对于大模型厂商相当重要。以后OpenAI、Anthropic等完全可以反过来引用这份判决:连判ROSS败诉的第三巡回法院,都明确认为ROSS与能够生成新表达、又不存在同等程度直接替代关系的通用大模型存在重要区别。所以,美国AI版权上诉首案并没有把大模型训练的合理使用问题关死。相反,它给通用大模型留下了一个口子。真正更麻烦的问题,藏在判决的第四项因素里。三、真正麻烦的是AI训练正在成为一个许可市场
合理使用第四项因素要求法院考虑,相关使用是否会影响版权作品现在或者潜在的市场。Thomson Reuters主张,ROSS造成的市场损害不只有一种。第一种比较容易理解。ROSS本身就是Westlaw的竞争对手,如果用户因为ROSS而不再订阅Westlaw,Thomson Reuters当然会受到直接商业影响。真正有意思的是第二种。Thomson Reuters提出,Westlaw判例要旨本身也可以授权给其他企业,用于训练AI。ROSS没有取得许可就拿这些内容训练模型,相当于绕过了一个Thomson Reuters本来可以收费的市场。ROSS的回应也很有道理:Thomson Reuters过去并没有大规模把这些判例要旨卖给其他公司训练AI。既然这一许可市场此前都没有真正建立起来,又怎么能说ROSS损害了它?第三巡回法院没有接受这个观点。法院首先引用美国最高法院Campbell案确立的标准:“The market for potential derivative uses includes only those that creators of original works would in general develop or license others to develop.”“潜在衍生用途的市场,仅包括原创作品的创作者通常会自行开发或者授权他人开发的市场。”这句话本身其实是在设限。并不是版权人今天突然想到一种新的收费方式,就可以宣布“这里存在一个潜在市场”,然后以别人没有付费为由否定合理使用。问题仍然在于,这是不是权利人通常会自行开发,或者授权他人开发的市场。但第三巡回法院随后明确认定:“the market for licensing headnotes as text to train AI is rapidly developing.”“将判例要旨作为文本授权用于AI训练的市场正在快速发展。”法院还特别注意到,Thomson Reuters自己已经在利用这些判例要旨训练AI搜索产品。因此,“判例要旨用于AI训练”并不是一个纯粹想象出来的商业场景。随后,法院说得更加直接:“By copying the headnotes for use as training data without Thomson Reuters’s authorization, ROSS usurped Thomson Reuters’s opportunity to enter that derivative market and license its headnotes for that purpose.”“ROSS未经Thomson Reuters授权复制判例要旨并将其用于训练数据,侵占了Thomson Reuters进入这一衍生市场、并为该目的许可其判例要旨的机会。”这可能是整份判决里,对未来通用大模型最值得继续观察的一句话。把Westlaw判例要旨换成书籍、新闻、图片、音乐或者其他版权内容,内容权利人完全可以提出类似主张:我的作品现在已经可以授权给AI公司用于模型训练,而且越来越多AI公司确实愿意为高质量训练数据付费,因此“AI训练许可”正在成为一个真实市场。问题随之而来。如果越来越多出版社、新闻机构、图片平台开始向AI公司出售训练许可,那么“过去没有AI训练许可市场”这个事实抗辩,就会越来越难成立。但大模型公司同样有一个很强的反驳。如果某种训练行为本来就属于合理使用,那么它原本就不需要购买许可。版权人不能因为自己愿意出售一项许可,就反过来说:“既然你没有买我的许可,所以你损害了我的许可市场;既然你损害了许可市场,所以你的行为不是合理使用。”否则,很容易形成一个循环:AI训练需要许可,因此存在AI训练许可市场;未经许可训练损害这一市场,因此不属于合理使用;既然不属于合理使用,所以AI训练需要许可。如果这套逻辑可以无限延伸,版权人理论上几乎可以为任何原本可能属于合理使用的行为设置收费许可,再用“你没有付费”反过来证明市场损害。ROSS并没有解决这个问题。而且必须准确理解本案的边界。ROSS的事实对Thomson Reuters非常有利:一方面,Thomson Reuters自己已经在使用这些判例要旨开发AI产品;另一方面,ROSS训练出来的恰恰又是一个与Westlaw直接竞争的法律检索产品。因此,第三巡回法院没有宣布“以后所有版权作品都存在一个受法律保护的AI训练许可市场”。但它确实跨出了重要一步。美国联邦上诉法院明确承认,AI训练许可可以成为合理使用第四项因素中考虑的潜在衍生市场;而且,版权人过去没有真正出售过这种许可,并不当然意味着这一市场不存在。这对未来大模型版权诉讼的意义,可能比“ROSS败诉”本身更大。过去几年,大模型公司经常可以说,训练使用并没有替代原作品,也不存在一个稳定成熟的“训练许可市场”。但随着出版社、新闻机构、图片平台等不断与AI公司签订数据授权协议,这个市场正在从一个法律假设逐渐变成现实。未来真正困难的问题,可能不再是“AI训练许可市场到底存不存在”。而是一个正在形成的许可市场,究竟可以在多大程度上反过来影响合理使用的边界。ROSS没有给出答案。它只是把这个问题正式摆到了桌面上。回头看这份判决,第三巡回法院其实同时做了两件事。它拒绝接受一种过于简单的说法:只要把版权作品送进AI训练流程,就自动变成转换性使用。ROSS使用竞争对手人工整理形成的内容,为的是训练一个直接替代竞争对手的产品,“AI训练”三个字并没有替它洗掉这些事实。但法院也同样拒绝把ROSS变成所有AI训练案件的答案。它特意指出,能够生成新表达的大语言模型,以及不存在同等程度直接替代关系的产品,与ROSS存在重要区别。所以,美国AI版权上诉首案真正留下的,并不是一句“AI训练不属于合理使用”。它留下的是一条正在变得越来越清楚的分界线:法院可能不会抽象地回答“AI训练到底合不合法”,而会越来越具体地追问——用了什么作品,为什么需要这些作品,模型训练以后提供什么功能,是否产生新的表达,最终产品替代了谁,又损害了哪个市场。对于OpenAI和Anthropic,这给通用大模型留下了一个口子。对于出版商、新闻机构和其他内容权利人,法院又留下了另一句话:AI训练本身,正在成为一个可以谈许可、谈价格,甚至可能受到版权法保护的市场。ROSS输了。大模型还没输。但真正难拆的那颗雷,已经埋下。参考资料〔1〕United States Court of Appeals for the Third Circuit, Thomson Reuters Enterprise Centre GmbH v. ROSS Intelligence Inc., No. 25-2153, precedential opinion, 2026.https://www2.ca3.uscourts.gov/opinarch/252153p.pdf〔2〕Thomson Reuters Enterprise Centre GmbH v. ROSS Intelligence Inc.,第三巡回法院判决镜像。https://chatgptiseatingtheworld.com/wp-content/uploads/2026/09/Thomson-Reuters-v.-ROSS-Intelligence-252153p.pdf〔3〕United States District Court for the District of Delaware, Thomson Reuters Enterprise Centre GmbH v. ROSS Intelligence Inc.,2025年部分简易判决。https://law.justia.com/cases/federal/district-courts/delaware/dedce/1%3A2020cv00613/72109/770/〔4〕Campbell v. Acuff-Rose Music, Inc., 510 U.S. 569 (1994).https://supreme.justia.com/cases/federal/us/510/569/〔5〕Authors Guild v. Google, Inc., 804 F.3d 202 (2d Cir. 2015).https://law.justia.com/cases/federal/appellate-courts/ca2/13-4829/13-4829-2015-10-16.html〔6〕American Geophysical Union v. Texaco Inc., 60 F.3d 913 (2d Cir. 1994).https://law.justia.com/cases/federal/appellate-courts/F3/60/913/566184/原始来源: 陈Alan AI与数据合规