← 文章 / AI技术
Tom's Hardware 3小时前 · 2026-09-16 03:02:44 · 3 阅读

OpenAI 启动 Project Lilly 项目,聘请数百名承包商人工审核 ChatGPT 聊天记录以改进模型

AI 公司在版权、用户隐私等问题上的口碑一直不太好——除非它们自己成了吃亏的一方。不过大家普遍都知道,ChatGPT 这类平台的聊天记录会被用来改进模型。但具体怎么操作的,直到今天仍是个谜。《404 Media》刚发布了一篇关于 OpenAI 人工审核聊天记录流程的报道,解释了审核机制是如何运作的,以及其中有时会让真人读到用户的私密信息。

这个评分项目在 OpenAI 内部叫 Project Lily。该媒体获取了项目的操作指南、Slack 频道、真实的 ChatGPT 对话,当然还有对对话进行分类的评分体系。审核人员被称为"prompt reviewers",工作内容相当简单:查看匿名的真实聊天记录,评判 ChatGPT 回复的质量——回答是否切题,文字有没有过度使用"AI 腔"、居高临下的语气、表情符号或谄媚措辞等等。拟人化和"个人经历"都被明令禁止,也就是说,ChatGPT 可以说"我找到了一些信息",但不能说"作为一名厨师,我喜欢……"或"我懂你的感受"。

据一位审核员说,这份工作"非常机械重复",但时薪据报道超过 50 美元,对一份看起来相当简单的工作来说,待遇算高了。这位审核员还提到,审核指南经常变动,而且常常自相矛盾——这种感觉,大多数软件开发者应该都不陌生。

该人士认为,大多数用户可能并未意识到自己的聊天记录会被他人阅读,这一点令人尤为不安——许多用户将 ChatGPT 当作临时的朋友或治疗师,向机器人倾诉内心深处的秘密。

据称聊天记录会经过匿名化处理,审核人员看不到用户名,但 OpenAI 已向 404 Media 承认,这种过滤机制可能会遗漏部分个人数据,尤其在较短的对话中。该媒体还指出,在许多对话中,用户也会要求 ChatGPT 对聊天内容保密。据了解,提交给审核人员的聊天版本还包含了一份“用户记忆摘要”,其中记录了用户的问题和兴趣概述、上下文背景,甚至可能包括其所在位置。

关键在于,Lily 项目并不对聊天内容的实际事实准确性进行评分(仅标记明显错误),这意味着很可能还有另一个(或多个)团队在单独进行评估。同样,这项审查工作与人工安全检查是分开的,后者用于判断用户是否可能伤害他人(或推测是伤害自己)。

该项目的存在也表明,尽管这些 AI 公司试图营造的形象相反,模型的提升并非仅靠技术进步和更好的训练集就能实现——显然,仍然需要一定数量的能力合格的人类参与其中。

原始来源: Tom's Hardware

评论 (0)