
生成式AI的迭代升级,高度依赖海量文本、图片、音视频训练数据。产业实践中,多数大模型企业、数据服务商普遍采用爬虫技术,批量抓取公开网络小说、图文作品、摄影图片、影视片段、自媒体稿件,用于模型训练、参数微调与产品迭代。
随之而来的,是行业争议最大、涉诉最多的版权难题:公开可浏览的版权作品,是否可以直接拿来训练AI?商业大模型训练是否构成著作权合理使用?AI平台还能否依靠“技术中立”“避风港规则”免责?
这里需要先厘清规则依据:关于“训练行为是否构成合理使用”“平台能否免责”,主要依据《著作权法》确立的合理使用规则,并结合个案司法裁判逻辑综合判断;而最高人民法院《关于依法审理涉人工智能纠纷案件的意见》(下称《AI纠纷审理意见》)第十二条,则从“AI生成内容侵害他人在先著作权”的角度,明确了训练数据来源举证、开发者/提供者/使用者责任认定规则。本文为本所AI合规系列第五篇专题,结合《AI纠纷审理意见》第十二条、司法裁判逻辑与真实案例,系统拆解大模型训练数据版权红线、各方主体责任划分、平台责任认定标准及企业合规抗辩路径。
一、纠偏行业误区:AI训练≠天然合理使用 长期以来,AI行业存在普遍合规误区:只要用于模型训练、技术研发,即便未经许可批量使用他人版权作品,也属于合理使用,无需授权、无需付费、无需担责。 需要明确的是,合理使用并非没有边界的“免费通行证”。依据《著作权法》确立的合理使用判断规则,是否成立合理使用,需综合使用目的、作品性质、使用数量与程度、对作品市场的影响等因素个案判断;对商业规模化训练,司法实践总体从严把握,难以轻易成立合理使用。 司法审查中,法院通常重点考量以下五项核心事实: 1、使用目的:区分公益科研与商业迭代。以产品商业化、流量变现、付费服务为目的的训练行为,司法从严认定,基本不支持合理使用抗辩; 2、使用方式:是否完整复制原作核心表达、是否原样抓取全文全图、是否通过训练替代原作传播与使用价值; 3、作品类型:网络文学、原创图片、美术作品、影视片段、原创文案等独创性强、创作成本高的作品,司法保护力度更强; 4、使用规模与质量:批量、海量抓取整站作品,高频使用权利人核心原创内容,显著降低合理使用成立概率; 5、市场替代效果:训练行为是否挤占著作权人授权训练、商业传播、付费交易的合法市场,损害权利人预期商业利益。 实务结论(重点):企业商用大模型、通用大模型、面向C端服务的AI产品,未经授权爬虫抓取网文、图片、影视内容开展训练,目前司法层面已被认定为高风险行为,合理使用抗辩难获支持。
二、全链条责任划分:开发者、数据商、内容平台各司其责 《AI纠纷审理意见》第十二条要求,认定涉AI知识产权侵权责任时,应综合考量服务类型、行业特点、训练数据来源、各方参与度、采取的必要措施及获利情况等因素;开发者主张不侵权抗辩的,应责令其提供训练数据来源、训练过程记录、模型运行模式等予以佐证。据此,训练版权侵权的全链条责任逐步清晰: 1、大模型研发者:第一责任主体,承担最终审核义务 无论自行爬虫抓取,还是采购第三方数据集,模型研发方均为训练行为的最终实施主体。企业不能以“数据由第三方提供”当然免责,必须对数据集来源合法性、授权完整性、使用合规性承担实质审核义务;同时应能就训练数据来源、训练过程等提供佐证,否则其不侵权抗辩将难以成立。 2、数据服务商:直接侵权主体 未经许可爬取、整理、打包、售卖他人版权作品作为AI训练数据集,属于典型的侵害复制权、信息网络传播权行为,需独立承担停止侵权、赔偿损失责任,是产业链中的高频追责对象。 3、内容平台:过错归责、风险管控责任 网文平台、图库、视频平台若未开启反爬虫防护、放任第三方批量抓取站内原创内容,或主动开放接口供AI企业批量训练,未尽平台治理义务的,将依据过错程度承担相应侵权责任。 三、技术中立与避风港:不是万能盾牌,也并非一律失效 传统互联网平台常以“技术中立”“通知—删除”避风港规则主张免责。在AI新业态下,司法裁判强调:技术中立、避风港规则并不能当然成为免责盾牌,平台是否担责,核心看其是否尽到与技术能力相适应的合理注意义务、是否直接参与侵权。 通常而言,存在以下情形时,平台即便及时删除内容,仍可能难以免责: 产品功能设计天然诱导侵权,如一键复刻他人画作、一键改写原创网文、一键生成影视混剪内容; 算法推荐机制主动推送、放大侵权生成内容,扩大侵权传播范围与损害后果; 平台对高频侵权模式明知、应知,具备技术识别能力却未设置拦截、风控、审核机制; 平台自身参与数据抓取、模型训练、内容生成,属于直接侵权主体,完全不适用免责抗辩。 同时需要指出的是,这并不意味着AI平台“一律担责”。对于仅提供中立技术工具、已尽合理注意义务、未直接参与或诱导侵权的平台,司法实践亦可能认定其免责(详见下文典型案例)。
四、典型适配案例:上海首例涉AI大模型著作权侵权案 一审:上海市金山区人民法院(2025年11月宣判)|二审:上海知识产权法院(2026年落槌) 基本案情 原告某文公司系知名IP《斗破苍穹》动漫中“美杜莎”角色形象的著作权人。被告网络用户李某截取“美杜莎”角色的图片,在某AI图像生成平台(依托大模型与LoRA微调模型)训练出专属模型,批量生成与“美杜莎”相似度极高的图片,并公开发布、销售牟利,其他用户可借助该模型生成与美杜莎形象实质性相似的图片。原告将李某及该平台诉至法院,索赔200余万元。 法院裁判要点 1、用户责任:李某未经许可截取、使用他人受著作权保护的角色形象训练AI模型,并生成、发布、销售相似图片,构成对原告复制权、信息网络传播权等著作权的侵害,应承担停止侵权、赔偿损失责任; 2、平台责任:运营该AI平台的被告公司,因提供的是中立技术工具、已尽到合理注意义务、未直接参与或诱导用户侵权,适用技术中立原则,无需承担共同侵权责任; 3、判决结果:判令李某赔偿5万元并停止侵权;平台不担责。 案例实务启示 该案同时划出两条红线:其一,擅自截取他人受保护作品用于AI模型训练并商业化,构成侵权,个人用户同样不能免责;其二,AI平台并非“必然担责”,是否免责取决于其是否尽到与技术能力相适应的合理注意义务。这与《AI纠纷审理意见》第十二条“综合考量各方参与度、采取的必要措施等因素合理认定责任”的裁判逻辑一脉相承。对大模型企业而言,“爬虫+公开内容”的粗放式训练迭代模式风险极高,数据来源合规必须前置。
五、律师实务:维权与应诉、企业合规全流程指引 (一)权利人维权要点 1、证据固定:对对方爬虫行为、数据集抓取规模、模型宣传材料、商业化使用场景进行公证存证,固定侵权链路; 2、前置通知:向AI企业发送书面侵权通知,要求清除涉案训练数据、停止侵权训练、下架相关功能,留存完整送达凭证; 3、诉讼主张:请求停止侵害、删除侵权数据集、赔偿经济损失及维权合理开支,可结合行业授权许可费、被告侵权获益主张赔偿金额。 (二)AI企业合规整改要点 1、禁止无授权爬虫抓取原创网文、图片、影视、文案等版权作品用于商业模型训练; 2、外购数据集必须核验来源合规性,要求供应商提供权属证明、合规承诺、侵权兜底赔付条款,留存完整采购链路证据; 3、严格隔离科研测试数据与商业训练数据,禁止非合规数据流入商用模型; 4、完善AI内容风控体系,对复刻、改写、同质化生成等高风险功能设置拦截机制,杜绝产品功能诱导侵权; 5、规范投诉响应机制,建立标准化通知删除流程,同时摒弃“依赖技术中立即可免责”的错误认知。





