近日,多家海外媒体报道称,Meta曾开展一项内部代号为戛纳(Cannes)的AI安全测试项目。根据曝光的信息,该项目由Meta外包合作方负责执行,组织数百名外包人员创建大量未成年人身份的虚拟账号,向OpenAI的ChatGPT、Google的Gemini以及Character.AI等竞争产品发送涉及自杀、毒品、性、饮食失调等高风险问题,以测试这些AI聊天机器人的安全防护能力。这一事件迅速引发全球科技行业对于AI安全测试边界、商业竞争伦理以及数据合规性的广泛讨论。

根据外媒披露的内容,项目参与人员需要模拟13岁至17岁的未成年用户,与竞争对手AI进行长时间互动,并记录模型回复内容,最终整理成数据进行分析。据报道,仅2025年一次测试便累计提交超过45000条Prompt,覆盖数千种涉及心理健康、校园暴力、药物滥用、敏感情感关系等复杂场景。部分测试甚至包含图片输入,希望进一步验证各家AI模型面对多模态内容时的安全机制是否能够有效工作。
值得注意的是,Meta对此并未否认相关测试行为,而是表示,对竞争产品进行安全基准测试属于AI行业普遍采用的做法,目的是帮助评估聊天机器人在面对敏感内容时是否能够提供安全、适龄的回应。Meta同时强调,公司不会将竞争对手模型生成的内容用于训练自身AI模型。然而,OpenAI、Google以及Character.AI均表示,并未授权此次测试,并认为相关行为可能违反各自平台的使用条款。
此次曝光真正引发争议的,并不仅仅是大规模测试本身,而是测试方式。外包人员被要求伪装成未成年人,并持续向AI提出大量极端、具有诱导性的敏感问题。一些曾参与项目的工作人员表示,他们在工作过程中接触了大量令人不适的内容,甚至担心某些测试可能触及伦理风险。一些AI治理专家也认为,行业确实需要开展安全评测,但如此大规模、长期、隐蔽且未经目标平台授权的测试,已经超出了传统公开基准测试的范围,处于法律与行业规范尚未明确覆盖的灰色地带。
从AI行业的发展来看,各大科技公司近年来都在不断强化模型安全能力,尤其针对未成年人保护、自杀风险识别、暴力内容过滤以及药物滥用等高风险场景投入了大量研发资源。因此,对模型进行压力测试本身并非新鲜事,但如何确保测试合法、透明且符合行业规范,已经成为越来越重要的话题。本次Meta项目曝光,也进一步反映出全球AI企业之间的竞争,已经从模型性能扩展到安全能力、内容审核以及可信AI建设等多个维度。
未来,随着生成式AI持续普及,各国监管机构预计将进一步完善AI安全评测、第三方测试以及竞争行为的相关规则。对于AI开发者而言,建立公开透明、安全合规的评测机制,将有助于提升模型可信度;对于普通用户来说,此次事件也提醒人们,在享受AI带来便利的同时,模型安全、数据隐私以及未成年人保护仍将是行业持续关注的重要议题。