摘要
2025年7月21日,中国互联网络信息中心(CNNIC)在京发布的第56次《中国互联网络发展状况统计报告》显示,我国人工智能核心产业规模已接近6000亿元,人工智能企业数量超过4500家,算力规模位居全球第二。
然而,生成式人工智能的发展也带来了诸多监管问题,例如,模型训练所依赖的数据标注是否合法、生成内容是否需要显著标识等问题频频引发关注;此外,人工智能生成内容(AIGC)已开始引发包括知识产权、虚假信息等多类新型法律纠纷,成为行业和监管亟待解决的重点难题。
本文聚焦生成式人工智能合规治理中的三个关键问题:数据是否合法?内容如何标识?侵权谁来负责? 这三类风险覆盖了生成式 AI 从“模型训练—内容生成—产品落地”的完整链条。本文将结合有关国家标准及典型案例,深入解析生成式人工智能合规风险的表现形态与应对思路,并提出具体的合规建议,以期为企业/平台和法律实务提供参考。
生成式人工智能训练数据合规要点
生成式人工智能模型的训练过程依赖于大量高质量的训练数据,数据的合规采集和标注是保障模型合法、安全、可信的基础环节。当前,合规治理体系覆盖从数据采集、数据标注到核验的全流程,旨在从源头防控数据风险,降低生成内容的法律隐患。
数据标注是生成式人工智能模型训练过程中的关键环节,通指对原始数据进行人工或半自动方式的分类、标识和解释,以赋予其可被计算机理解的语义信息。例如,在图像识别任务中为图像中的目标物体进行分类和定位,在自然语言处理中标注词性、实体类别或情感倾向。通俗来说,就是在原始数据上加上“说明”或“标签”,帮助机器理解这些数据的意思。比如,在一张图片上标出“这是猫”,或在一段语音中标明“这里是愤怒的语气”等。
然而,训练数据合规的内涵远不止于“是否标注”,而是涵盖了对整个数据处理流程中合法性、安全性和可控性的全面要求,包括数据来源是否合法、标注行为是否规范、标注人员是否具备资质、标注过程是否留痕可追、是否建立核验机制等。因此,生成式人工智能训练数据的合规治理是涵盖从数据采集、标注到核验的综合性治理。
(一)数据采集合规
在数据标注之前,数据采集环节的合规同样关键。根据《生成式人工智能服务管理暂行办法》第七条的要求,生成式人工智能服务提供者必须使用合法来源的数据和基础模型,遵守国家数据安全、个人信息保护和知识产权等法律法规,避免未经授权的数据使用和隐私泄露风险。采集合规应重点防范以下风险:数据来源不明或未经授权,存在版权或隐私风险;采集范围超出“最小必要”原则,涉及过度收集敏感个人信息;跨境数据传输未符合相关安全评估和备案要求。
企业应建立完善的数据来源追溯和合规评估机制,明确数据用途和权限,并与第三方数据供应商签订严格的合规协议,保障数据合法合规使用。
(二)数据标注合规
针对人工智能数据标注合规,全国信息安全标准化技术委员会在经过近一年的意见征求后,于2025年4月25日出台了《网络安全技术——生成式人工智能数据标注安全规范》(GB/T 45674-2025),明确了数据标注安全评价方法。其中,与法律合规实务联系较为紧密的合规要求主要有标注规则要求、标注人员要求及数据核验要求。
1.数据标注规则合规要求
首先,数据标注组织方需制定完整、明确的标注规则,这不仅关系到数据标注质量的控制,也关乎合规性。标注规则应包括标注目标、数据格式、标注方法、质量指标等基本内容,确保每项标注活动都符合预定的安全标准。特别是在生成式人工智能数据标注中,需根据数据内容的不同(如文本、图片、音频等)对标注任务进行分类管理。
对于功能性数据(即用于训练生成式人工智能模型具备完成特定任务能力的数据标注)的标注,规则应确保数据的真实性、准确性与多样性,并提供正反例示范,以帮助标注人员准确执行任务。另一方面,安全性数据标注规则应特别注意识别与规避潜在的安全风险,如数据泄露、偏见生成或不当信息标注等。为此,组织方必须确保标注人员能够根据明确的规则判定安全风险内容,避免在标注过程中产生有害或误导性数据。
2. 数据标注人员合规要求
数据标注人员的管理是保障标注过程合规的核心之一。组织方必须为标注人员提供详细的安全培训,培训内容不仅涵盖数据标注规则,还应包括平台使用、数据安全管理、常见安全风险场景及应对方法等。通过定期培训与考核,确保标注人员具备必要的法律意识、标注技能以及处理安全问题的能力。培训考核结果必须进行记录,并对不合格的人员暂停或取消其标注资格。人员管理中,标注任务的分配应明确各角色职责,避免标注执行人员与审核人员为同一人。特别是在数据标注出现争议时,应通过仲裁人员作出最终裁定,并保留详细的记录文档,确保任务分配和管理的透明与公正。
此外,人员管理中,除了要确保标注人员履行岗位职责外,组织方还应加强对标注活动的监督,对标注过程中的质量控制和安全性风险进行实时监控。对于离岗人员或因违反规定被取消资格的标注人员,应及时撤销其对平台工具和数据的访问权限,防止潜在的安全风险。
3. 数据核验合规要求
数据标注结果的核验是确保数据标注合规的关键环节。组织方需根据安全性标注数据的比例与质量要求,确保至少 3%的数据经过严格的安全核验。
标注结果核验方式可采用人工抽查与自动化工具相结合的混合核验方式,确保标注数据的准确性和安全性。对于标注质量不合格的部分,应及时进行纠正或重新标注,并对相关人员和标注结果进行记录与追踪,形成完整的合规追溯链条。
在进行安全性标注核验时,特别要确保生成的数据没有包含安全风险信息,如非法、虚假或误导性的内容,并确保所有标注数据符合相关法律法规5的要求。当安全性标注数据的核验失败比例超过 5%时,应废除该批次标注结果。
人工智能生成内容标识合规要点
生成式人工智能技术的发展不仅要求训练数据合规,更强调生成内容的透明标识和易于识别。人工智能生成内容(AIGC)的明确标识,直接关系到信息真实性的保障、用户知情权的维护以及后续法律责任的认定。人工智能生成内容标识,是指对利用人工智能技术生成或合成的内容(如文本、图片、音频、视频、虚拟场景等信息)进行来源和性质标注的方式。2025 年 3 月 7日,国家互联网信息办公室等部门颁发《人工智能生成合成内容标识办法》,列明 AIGC 标识的各种注意事项,结合 2025 年 2 月出台的《网络安全技术——人工智能生成合成内容标识方法》,人工智能生成合成内容标识的合规要点可以总结在显/隐式标识、用户提醒两方面。
(一)显式与隐式标识
合规的人工智能生成内容必须具备明确的标识,分为显式标识和隐式标识。显式标识指通过文字、声音或图形等形式在内容中显著标示出其为人工智能生成的合成内容,要求用户能够明显感知到;而隐式标识则通过技术手段在文件元数据中嵌入标识,不易为用户察觉。服务提供者应根据不同的内容类型(文本、图片、音频、视频等)在适当位置添加显式标识,并在文件元数据中进行隐式标识。显式标识的形式和位置应根据内容的特性而有所不同,以确保标识的清晰度与可识别性。
(二)用户提醒
服务提供者应在用户协议中明确标识规范,特别是标识的方式、样式等内容,确保用户知晓并遵循相关规定。若用户要求去除显式标识,服务提供者在提供相关服务时需通过协议明确用户的责任,同时遵循日志保存要求,至少保存相关记录六个月。
涉 AIGC 典型案例
前文介绍了生成式人工智能从训练数据采集、标注、核验到生成内容显式与隐式标识的合规框架,目的在于确保生成式人工智能输出内容的合法性、安全性与可识别性,防范侵权与信息失真。然而,在实践中,围绕 AI 生成内容引发的知识产权纠纷和平台责任问题日益凸显,以下选取三起代表性案件,分析 AIGC 合规风险的典型表现及平台责任边界。
(一)广州奥特曼案——AI 生成图片构成著作权侵权
1. 案件情况
2024年2月8日,广州互联网法院作出国内首例生成式 AI 服务侵犯著作权的判决(案号:(2024)粤 0192 民初 113 号)。该案原告为“奥特曼”系列形象的合法权利人,被告则是一 AI 平台的运营主体。被告所运营的 AI 生成工具平台能够生成形似奥特曼及其他衍生物的图片,原告认为该些图片构成对原告的知识产权侵权,要求被告承担相应的侵权责任。被告则认为图片并非被告主动生成的,且被告并未通过这些图片获利,因此不构成著作权侵权。
广州互联网法院认为,《生成式人工智能服务管理暂行办法》第四条规定,提供和使用生成式人工智能服务应当遵守知识产权的相关规定,因此被告应当具备一定的注意义务,但是被告并未设立投诉举报、风险提示机制,也不存在生成物标识。因此,法院认为被告的行为侵害了原告对案涉奥特曼作品享有的复制权、改编权,依法应承担停止侵害、赔偿损失等民事责任。
2. 合规提示
AI 生成工具提供者需要保护第三方的知识产权,并采取有效措施避免侵权 AI 生成物的产生。综合法院的判决理由,AI 生成工具提供者需要积极履行自身的合规审查义务,避免侵害潜在第三方的著作权利。
(1)建立关键词屏蔽机制:为避免生成式人工智能平台生成侵权内容,平台应建立严格的关键词过滤系统。例如,针对“奥特曼”等具有高知名度的 IP,平台应特别设置相关关键词,防止用户上传未经授权的作品或生成相关的侵权内容。
(2)对AI生成物进行有效标识:值得注意的是,在本案中,虽然被告在收到举报后屏蔽了关键词“奥特曼”,但平台用户仍然可以通过其他提示词绕开屏蔽机制。在这种情况下,AI 生成工具提供者则必须通过履行《生成式人工智能服务管理暂行办法》第十二条所规定的标识义务,对 AI 生成内容进行有效标识,防止与原权利作品产生混淆。
(3)完善违规行为的反馈与处理机制:平台应设置违规报告渠道,让用户可以举报涉嫌侵权的生成内容,同时平台应有明确的处理流程,包括即时删除违规内容、对上传者进行警告或处罚等措施,以加强平台的知识产权保护责任。
(二)杭州奥特曼案——AI 生成服务不构成不正当竞争
1. 案件情况
2024年12月30日,杭州市中级人民法院对我国首例生成式人工智能平台不正当竞争案作出终审判决(案号:(2024)浙 01 民终 10332 号)。
该案原告为“奥特曼”系列形象在我国的合法权利人,被告系某 AI 平台运营商,平台支持用户上传素材并训练模型生成图片。部分用户通过上传奥特曼图片生成相关内容,原告据此认为平台提供定向训练服务,未经授权使用涉案作品,造成侵权生成物大量传播,构成不正当竞争。被告则辩称技术具有中立性,平台已尽合理管理义务,且无主观恶意。
法院认为,被告主观上并无违反诚实信用原则和商业道德的故意,客观上亦未实施损害他人合法权益的行为,并已设有用户协议、技术限制及监控机制,及时处置涉嫌侵权内容,未扰乱市场秩序,故不构成不正当竞争。
2. 合规提示
法院作出免责判定的前提是平台已建立完备的合规体系,包括合理使用条款、用户引导、监测预警机制等。如平台未尽相应义务,即可能被认定构成不正当竞争。因此,AI工具提供者应持续完善合规机制,平衡创新与知识产权保护。
(1)及时下架可疑内容:AI 平台应建立有效的内容监控系统,及时发现并下架涉嫌侵权的生成内容。平台应设置自动化检测工具与人工审核相结合的机制,确保生成的图像、文本等内容不侵犯第三方的知识产权。
(2)强化用户提示义务:平台应通过明确的用户协议、指南和操作提示,提醒用户其上传的内容必须符合版权法和平台使用规定。在上传和生成内容之前,用户应被告知平台对知识产权的保护政策,以及未经授权的作品不能用于生成和训练。
(三)北京 AI 拼图案——AI 生成侵权构成刑事责任
1. 案件情况
2024年6月,北京市通州区人民法院对“北京 AI 拼图侵权案”作出判决,该案为北京市首例利用人工智能侵犯著作权并判处刑事责任的案件。该案原告为张某、刘某某等多名美术作品著作权人。被告则是福州市某电子商务有限公司及罗某某、姚某某等 4 人。被告人罗某某、姚某某等 4 人,于 2024年 3 月至 7 月间,共谋从互联网平台下载他人美术作品后,使用开源软件生成侵权图片,制成拼图对外销售。原告认为被告利用 AI 对原创画作进行微调并规模化牟利的行为,已构成侵权及刑事犯罪。被告则认为只要图片不是 100%复制,做了些许改动,就不算侵权。
根据《中华人民共和国著作权法》的相关规定,构成作品的核心标准是“独创性”,即作品须体现出作者“最低限度的智力创造性”。法院指出,本案中,被告人未对生成的拼图图片投入智力劳动,例如设置迭代步数、修改随机数种子、增加提示词内容等。因此其对生成结果缺乏实质性的创造。法院认定被告单位及被告人的行为侵害了原告对作品享有的著作权,依法应承担罚金、有期徒刑等刑事责任,并退缴违法所得、赔偿民事损失。
2. 合规提示
法院明确指出,使用 AI 生成内容时,单纯依靠技术手段掩盖侵权行为,不但不能免除法律责任,反而可能触及更严重的刑事处罚。
(1)AI 生成工具使用者不得以“借助工具”或“微调内容”为由规避法律责任。在输入素材、提示词或上传训练数据时,应预判并审查素材的著作权状况,避免使用未经授权的他人作品。
(1)AI 生成工具提供者对外应关注平台可能被用于侵权的风险,强化对用户生成内容的管理和引导,防止滥用。
(3)AI 生成工具提供者对内应加强对素材使用的内部合规控制,建立素材使用白名单、限制模型训练范围等措施。
结语
综上所述,生成式人工智能技术的健康发展离不开全链条的合规治理。从训练数据的合法采集、规范标注及严格核验,到生成内容的显式与隐式标识,再到实际应用中面临的知识产权保护和市场秩序维护,均需法律法规与技术手段的协同保障。合规不是限制创新,而是保障技术可持续发展的基石。只有在合法合规的轨道上前行,生成式人工智能技术才能真正服务于经济社会发展与公众利益,走向更加成熟和稳健的未来。 |