×

打开微信,扫一扫二维码
订阅我们的微信公众号

×

扫码分享

光大律师事务所
EN
 
[摘要]围绕最高人民法院发布的《关于依法审理涉人工智能纠纷案件的意见》,本所律师陆续推出系列解读文章。本期刊发第三篇,聚焦大模型训练中的个人信息保护,梳理公开个人信息的处理边界、相关主体责任与企业合规要点。

640 (9).jpg



生成式AI产业高速发展,模型训练的数据合规,始终是企业最需要警惕的法律风险。不少AI企业有一个普遍的认识误区:网络公开的图文、视频、评论、肖像、语音,既然任何人都能浏览、下载,就可以直接抓取、清洗、入库,用于大模型训练、微调、迭代,无需授权,也无需告知。


但司法裁判的立场正在逐渐清晰。最高人民法院《关于依法审理涉人工智能纠纷案件的意见》(下称《意见》)正式以司法规则定调:信息公开,不等于可随意用于AI训练。公开渠道获取的个人信息,仍受民法典、个人信息保护法严格保护;只有在合理范围内处理个人自行公开的或者其他已经合法公开的个人信息,且个人未明确拒绝的,一般不认定为侵害个人信息权益的行为。


本文是本系列解读的第三篇,聚焦大模型训练场景下的个人信息合规边界,结合《意见》条文、司法裁判标准与典型案例,厘清AI数据爬取、清洗、训练、微调全流程的合法边界,明确开发者、数据服务商、平台运营方的责任划分与合规抗辩路径。



一、行业核心误区:打破“公开即免费可用”的惯性思维

长期以来,AI行业普遍存在三大合规误区,也正是《意见》重点纠偏的司法痛点:


误区一:认为互联网公开内容属于公共资源,企业可无偿抓取、无限复用;


误区二:认为用户自行对外公开的肖像、昵称、动态、语音数据,等于概括同意被AI训练使用;


误区三:认为只要不直接商用、仅用于模型迭代训练,就不构成侵权。


《意见》直接否定了上述观点,确立了核心裁判逻辑:个人信息的公开,不等于同意被AI自动化抓取、规模化训练、算法化利用。个人将信息对外公开,通常是为了社交展示、信息交流,而非授权AI企业进行数据抓取、模型训练、商业变现。


需要强调的是,《意见》并非一概禁止使用公开数据训练,而是要求处理须在“合理范围”内。是否超出合理范围,应综合考量处理个人信息的目的与模型功能的必要性和适当性,所涉个人信息的类型、敏感程度及对个人权益的潜在影响,以及个人公开信息时的场景和可合理预期的使用范围。




二、新规明确:AI训练侵害个人信息的认定标准

《意见》第(六)条确立了训练数据处理的合法性判断标准。综合条文与司法裁判规则,认定AI模型训练侵害个人信息权益,可归纳为以下四个要件:


1、侵害的客体为个人信息权益

自然人的肖像、人脸特征、声音音色、日常言论、网名、行踪轨迹、生活照片、社交动态等,能够单独或结合其他信息识别特定自然人的内容,均属于《个人信息保护法》规制的个人信息;其中人脸、声音等生物识别信息属于敏感个人信息,保护层级更高、合规要求更严。


2、实施了处理个人信息的行为

数据爬取、解析、清洗、标注、入库、模型训练、参数微调、特征提取,均属于法律意义上的个人信息处理行为,受严格规制。


3、未取得有效同意、未完成合规脱敏

处理普通个人信息未取得知情同意,处理人脸、声音等敏感个人信息未取得单独明示同意,且未采取有效脱敏、去标识化处理,即落入侵权范畴。


4、超出合理使用范围

即便出于技术研发目的,大规模、常态化抓取自然人公开个人信息用于模型迭代,超出合理范围的,也应认定为侵害个人信息权益。


三、合法抗辩边界:哪些AI训练行为不构成侵权?

《意见》并非一概禁止使用公开数据训练,而是明确了合法使用的有限场景,企业可据此构建合规抗辩体系:


1、主体明示授权:针对特定自然人信息,取得书面、弹窗勾选、协议确认等有效明示同意;敏感个人信息须单独授权,且明确使用用途、训练范围、保存期限。


2、彻底脱敏处理:对抓取数据实施不可逆去标识化处理,无法复原、无法关联特定自然人,且无任何识别可能性的,不再属于个人信息处理行为。


3、公共利益合理使用:用于公共科研、学术研究、公益技术攻关,不用于商业训练、不对外商业化输出、不产生经营收益的有限使用。


4、纯粹通用数据训练:仅抓取公开通用资讯、通用知识内容,不包含任何可识别自然人的个人特征、私人信息的训练行为。


需要重点警示:轻微模糊、简单打码、事后筛选剔除,均不构成合法脱敏。司法裁判要求脱敏必须事前、不可逆、彻底消除个人可识别性。


脱敏,不是打码了事,而是彻底消除可识别性。




四、主体责任划分:开发者、数据服务商、平台各司其职

《意见》细化了AI训练全链条主体责任,回应“谁爬取、谁担责、谁兜底”的实务争议:


1、模型开发者(核心责任主体)

自行抓取数据训练模型,或委托第三方数据公司训练模型的,开发者为第一责任人,对数据来源合法性、处理合规性、脱敏有效性承担最终审核义务。


2、数据服务商(直接侵权主体)

专门提供AI训练数据集、标注数据、人脸语音数据的服务商,若非法采集、售卖个人信息数据,构成直接侵权,需独立承担赔偿责任。


3、运营平台(过错责任)

平台明知或应知模型训练存在个人信息侵权,仍提供流量、技术、存储支持,或未履行风险管控义务的,构成帮助侵权,承担连带责任。




五、典型适配案例:全国首例AI声音侵权案


审理法院:北京互联网法院|入选北京互联网法院“服务保障新质生产力十大典型案例”


基本案情

原告殷某是一名配音演员,其发现自己的声音被AI化后,在一款名为“魔音工坊”的应用上以“魔小璇”名义对外出售。殷某以侵害声音权益为由,将“魔音工坊”运营主体北京某智能科技有限公司等五家公司诉至北京互联网法院。


裁判核心要点

1、在具备可识别性的前提下,自然人声音权益的保护范围可及于AI生成的声音——未经许可将他人声音用于AI语音产品并商业化使用,侵害声音权益;


2、对录音制品的授权,不等于对AI生成声音商业化使用的授权;公开、可获取的声音素材,不构成对AI训练与变现的概括许可;


3、被告以商业经营为目的使用原告声音并获利,具有明显过错,应当承担书面道歉、赔偿损失等民事责任。法院最终判决被告赔偿25万元并书面道歉。


案例实务启示

该案确立了“声音权益及于AI生成声音”的司法规则。《意见》第(四)条亦明确:未经自然人同意,使用其声音作为训练语料,模仿其音色、语调和发音风格生成可识别的合成人声,侵害声音权益。据此,企业以“网上公开可查”为由,未经授权抓取人脸、声音、个人动态用于模型训练和商业化运营,均存在侵权风险。此类行为还可能同时落入第(六)条个人信息权益保护的规制,形成人格权与个人信息权益的双重保护。




六、律师实务与企业合规实操指引

结合《意见》与司法判例,针对AI企业模型训练业务,梳理可直接落地的合规风控要点:


1、数据集准入风控:建立数据来源审核机制,禁止直接爬取社交平台、短视频平台公开个人内容用于模型训练;外购数据集必须要求供应商提供合规承诺、授权证明、脱敏报告。


2、敏感信息专项管控:对人脸、声音、生物特征类数据实行严格准入,未取得单独明示授权的,不得入库训练;确需使用的,应留存完整授权链路证据。


3、脱敏流程标准化:制定不可逆脱敏、去标识化技术标准,留存脱敏日志、技术凭证,作为后续司法抗辩的核心证据。


4、风险隔离机制:区分科研训练与商业训练数据池,公益科研数据不得流入商用模型迭代体系,避免合规风险传导。



2026 ©上海市光大律师事务所 | 免责条款 | 律谷科技出品