恒盛注册观法
数据与人工智能法丨AI训练数据合规:法律风险全景解析与企业治理框架
作者:admin 2026-08-07

微信图片_20260807140856_366_7.jpg


引言


从政策演进看,我国对人工智能训练数据的治理,已从早期“鼓励建设和开放利用”,逐步转向“发展利用、安全治理与伦理审查并重”。2026年《人工智能科技伦理审查与服务办法(试行)》则将训练数据选择标准、算法模型设计合理性、公平公正、防止偏见歧视等事项纳入伦理审查重点。结合“十五五”规划纲要关于建立人工智能训练数据合理使用制度的表述,训练数据已不再只是模型训练素材,而是数据合规、网络安全、算法治理和科技伦理共同关注的核心对象。


因此,AI训练数据合规不应仅被视为数据来源核查或模型训练前置工作,而应纳入人工智能产品全生命周期治理,并上升为企业业务战略与整体风险管理体系中的基础性议题。

 

一、AI训练数据的处理环节与数据保护义务


从企业实务看,AI训练数据合规通常可拆分为(1)数据采集、(2)数据加工、(3)数据入库以及(4)数据存储四个主要环节。四个环节分别对应数据来源合法性、数据质量与权利处理、数据准入与可追溯管理,以及存储安全、留存期限和删除机制等核心合规问题。

 

图片1.png

图1-AI训练数据处理主要环节与合规义务


(一)数据采集阶段


数据采集阶段,需要确保来源合法性,这是数据训练的起点,也是后续训练环节合规的基础。


1.企业自有数据


企业自有数据并不当然可以自由用于训练。自有数据中可能包含个人信息、敏感个人信息、商业秘密、重要数据甚至核心数据。涉及个人信息的,应判断是否具备合法处理基础,并结合训练目的履行告知同意、最小必要、个人信息保护影响评估和删除响应等义务。涉及重要数据或核心数据的,应结合所在地区、行业主管部门规则和数据分类分级目录进行识别,落实相应保护要求


2.第三方采购或合作数据


企业就第三方采购或合作数据应重点审查授权链条。企业通过数据交易、许可、合作开发或委托处理取得数据时,应确认数据提供方是否有权提供该数据,数据是否可以用于AI训练、微调、模型迭代和商业化部署,并在合同中明确转授权权利、个人信息合规责任、知识产权瑕疵责任、授权期限届满后的数据处理方式以及模型成果处理安排。1


3.用户输入上传数据


用户输入数据包括prompt、上传文档、聊天记录、语音图像、客服录音、评分反馈、纠错反馈、使用日志等。用户向平台提交内容,通常只能说明其为当前服务目的提供数据,并不当然表示同意平台将其用于通用模型训练或后续产品优化。根据《个人信息保护法》第14条的规定,以及《生成式人工智能服务管理暂行办法》相关规定,用户输入或上传内容用于训练,应作为独立处理目的管理。企业不能仅以用户已经提交给平台为由推定训练授权,需将该处理目的披露清楚并依据情况获取同意。


4.公开数据


实务观点就“公开数据并不等于随意训练”存在共识,企业应针对公开数据开展来源评估、使用范围评估和权利状态评估,避免将来源不明、禁止商用、禁止训练或许可不兼容的数据纳入训练集。针对通过自动化程序收集公开数据,国家数据局指出需不非法侵入他人网络、不干扰网络服务正常运行、不破坏有效技术措施、以及不损害个人和组织合法权益。

 

(二)数据加工阶段


对于训练数据而言,去标识、清洗、标注等技术处理,均可能涉及个人信息保护、数据安全、知识产权和内容安全要求。TC260-005《人工智能应用伦理安全指引1.0》于2026年5月19日发布,针对包括应用开发者与服务提供者在内的企业,就AI训练保留人类控制、防范数据滥用、关注易受影响群体等伦理标准提出要求。企业据此应当在数据处理阶段针对数据质量与内容予以格外关注。


1.个人信息去标识化、匿名化


首先,仅做去标识化处理的数据,一旦搭配其他外部信息能够锁定具体个人,就仍属于个人信息。通常业务场景下,普遍认为只有完全匿名化、彻底无法识别自然人且无法复原的数据,才不受个人信息相关法规管控。然而,基于大模型场景的最新技术发展,即使企业在数据输入模型前进行了技术处理,也不能当然认为数据已经达到法律意义上的匿名化。对于未达到不可逆匿名化标准的数据,模型训练过程中学习形成的统计关联、特征表示或参数信息,在特定技术条件下仍可能增加重新识别风险,因此匿名化效果应结合具体模型架构、训练方式及攻击场景进行持续评估。


2.训练数据质量、多样性和偏见治理


训练数据质量不仅决定模型性能,更直接影响企业的数据治理和合规风险。2训练数据质量管理已成为企业履行数据保护义务、证明AI系统可信与合规的重要组成部分,而非单纯的模型优化措施。企业应将训练数据质量纳入AI治理框架,通过数据质量评估、来源审查、版本控制、偏差检测、数据血缘(Data Lineage)和可追溯记录等机制,形成可审计的数据治理能力,以满足日益强化的AI合规和监管要求。


3.侵权内容过滤与权利清洗


训练数据中若包含未经许可或权利状态不明的数据集,企业在清洗阶段不能只做格式处理,还应进行权利清洗。对于盗版数据库、未经许可的图库/新闻库/代码库、来源不明的素材包、明显带有第三方商标或知名形象的素材,应设置更高审查门槛或禁止进入训练数据集。


权利清洗并不意味着企业必须对每一个样本逐件取得授权,至少应对公开数据、开放许可数据、自有数据、用户上传数据、第三方采购数据等进行分类管理,并留存授权协议、许可条件、数据来源及处理记录,确保数据来源具有可验证性和可追溯性。


4.数据标注


根据《生成式人工智能服务管理暂行办法》第8条明确规定,企业针对标注规则、标注质量、标注人员合规培训、外包标注安全管理、标注平台权限控制负有合规义务。

另外需要注意实践当中,存在委托第三方进行数据标注的情况,此时企业除去针对自身的上述合规义务,还应明确双方的数据处理职责、安全措施、保密义务、数据留存期限及删除要求,并持续监督受托方履约情况。


通过建立全过程质量审核、抽样复核和版本管理机制,可有效降低错误标注、偏差传播以及数据泄露等风险,提高训练数据的可信度和合规性。

 

(三)数据入库阶段


入库的核心目标并非再次开展数据清洗,而是在前序处理完成的基础上,对数据合规状态进行最终确认,并完成登记、标注和权限初始化,使训练数据进入可管理、可追溯、可使用状态。在该环节,企业应重点建立以下管理机制:


1.建立训练数据准入确认机制


企业应在入库前建立训练数据准入规则。在入库前完成数据来源合法性确认,对于不符合要求的数据进行隔离、退库或者删除处理。


2.完成分类分级及元数据登记


入库时应同步完成数据分类分级(如个人信息、敏感个人信息、重要数据、版权风险数据等)以及元数据登记,记录数据来源、采集方式、授权依据、处理流程、版本信息、责任主体、有效期限等信息,确保数据全生命周期可追溯。


3.初始化访问权限和使用范围


依据数据分类结果建立访问控制策略,落实最小权限原则,明确不同人员、模型及业务场景的访问权限,并通过权限审批、访问日志等措施防止训练数据被超范围使用。


4.建立数据台账和追溯机制


建立训练数据台账、批次编号及对应数据记录,实现每批训练数据来源可追溯、风险等级可识别、使用范围可控制、访问行为可审计,并支持必要时的数据删除、隔离、回滚及重新评估。


5.建立入库闭环管理机制


入库环节原则上仅负责确认、登记和标识,不承担二次清洗或二次合规审查职责;发现数据存在来源、授权或质量问题的,应退回清洗或处理环节整改,形成“处理—入库—反馈”的闭环管理机制。

 

(四)数据存储、删除和生命周期管理阶段


训练数据进入存储阶段后,企业仍负有持续合规义务。企业应重点围绕三类问题建立持续控制机制:一是数据应保存多久、何时删除或停止使用;二是数据在存储和访问过程中应采取何种安全技术措施;三是数据是否存在境外存储、远程访问或跨境提供情形,并据此判断是否触发数据出境合规义务。


1.保存期限设置与删除义务


对于个人信息、敏感个人信息、未成年人信息、商业秘密、重要数据、权利状态不明作品和高价值专业数据库,企业应设置保存期限、复核机制和删除触发条件,避免数据超出必要期限的留存。


2.存储安全管理措施


依据《数据安全法》《个人信息保护法》等规定,企业应针对训练数据建立覆盖存储、访问、使用、备份、恢复及销毁等环节的安全管理制度,结合数据敏感程度采取身份认证、访问控制、加密存储、日志审计、备份恢复、异常监测等技术和管理措施,并定期开展安全评估、风险排查及人员安全培训,持续保障训练数据的机密性、完整性和可用性,降低数据泄露、篡改、滥用及未经授权访问等安全风险。


3.存储位置与跨境数据合规


企业应结合训练数据的实际存储位置、管理主体及访问方式,持续评估是否涉及数据出境。原则上,仅在境内服务器存储,且境外主体无法访问、调用、下载或远程处理相关数据的,通常不构成数据出境;但若训练数据存储于境外服务器、或存在境内外合作、或境外主体能够通过远程访问、运维支持、模型训练、推理调用等方式获取或处理相关数据,则应进一步评估是否触发数据出境合规义务,并根据适用法律履行相应的评估、备案、认证或合同保障等要求。

 

二、AI训练数据的知识产权红线


AI训练数据的知识产权风险,是当前生成式人工智能治理中最具争议的问题之一。相较于个人信息保护主要关注数据主体权益,知识产权保护更关注训练数据本身是否属于受法律保护的作品或者其他智力成果,以及企业在训练数据采集、复制、清洗、标注、入库、模型训练、模型发布及生成内容传播过程中,是否超出法律允许或授权许可的使用范围。


对于中国企业而言,训练数据知识产权合规不仅涉及《中华人民共和国著作权法》《中华人民共和国反不正当竞争法》《中华人民共和国民法典》等法律规定,还受到《生成式人工智能服务管理暂行办法》的专门规制。虽然我国目前尚未针对AI模型训练建立专门的著作权制度,但训练数据合法来源、知识产权保护以及合理使用边界已经成为监管重点,也是近年来司法实践持续关注的问题。

 

(一)AI训练数据涉及的知识产权法律规则


目前,我国关于AI训练数据知识产权保护主要形成了“生成式人工智能监管规则+著作权法+民事法律”相结合的监管体系。


首先,《生成式人工智能服务管理暂行办法》首次对AI训练数据提出了直接要求。


《生成式人工智能服务管理暂行办法》第七条规定:


提供者应当依法开展预训练、优化训练等训练数据处理活动,遵守以下规定:


(一)使用具有合法来源的数据和基础模型;

(二)涉及知识产权的,不得侵害他人依法享有的知识产权。


该条明确要求企业不仅应确保训练数据来源合法,而且不得因模型训练侵害他人依法享有的知识产权,是我国目前针对AI训练数据知识产权保护最直接的法律依据。


其次,训练数据处理活动通常会涉及著作权法规定的复制、改编、汇编等专有权利。


《中华人民共和国著作权法》第十条规定:


著作权包括复制权、发行权、出租权、展览权、表演权、放映权、广播权、信息网络传播权、摄制权、改编权、翻译权、汇编权以及其他依法享有的权利。


实践中,训练数据下载、抓取、缓存、复制、清洗、标注、构建数据集以及模型训练等行为,均可能涉及复制权;多个作品形成训练数据集,可能涉及汇编权;模型输出与作品表达高度接近时,还可能涉及改编权、信息网络传播权等著作权人的专有权利。


上海知识产权法院在“美杜莎案”中明确,未经授权使用他人作品训练并发布LoRA模型,可能构成复制权和信息网络传播权侵权;但模型生成内容是否构成作品,仍应以是否具有独创性智力投入进行个案判断。


此外,若训练数据包含数据库、软件源代码、商业秘密、人物肖像、声音等内容,还可能分别涉及《反不正当竞争法》关于商业秘密保护、《民法典》关于肖像权、声音权益及个人信息权益等规定。因此,训练数据知识产权合规并非仅限于著作权保护,而是覆盖训练数据全生命周期可能涉及的多种民事权益。

 

(二)AI训练中的合理使用仍存在较大法律不确定性


目前,AI模型训练是否构成著作权法意义上的合理使用,仍是国内外争议最大的法律问题之一。我国《著作权法》第二十四条采取列举式立法模式,对合理使用情形进行了明确规定,包括个人学习、新闻报道、课堂教学、国家机关执行公务等十三类情形,但并未将生成式人工智能训练、机器学习训练或者商业化模型训练明确列入合理使用范围。因此,截至目前,我国法律并未确立“AI训练属于合理使用”的一般规则。


近年来,国内司法实践已经开始关注AI训练涉及的知识产权问题。例如,在涉及生成式人工智能平台的部分案件中,法院已经开始审查模型训练过程中是否存在未经授权使用作品、是否影响权利人正常市场利益以及平台是否履行合理注意义务等问题。但总体来看,我国尚未形成针对AI训练行为是否构成合理使用的统一裁判标准,相关案件仍主要依据具体案情进行个案判断。


因此,对于中国企业而言,不宜直接援引美国Fair Use或者Transformative Use理论作为训练行为合法性的依据,而应优先依据我国现行法律判断训练数据是否具有合法来源、是否取得必要授权、是否超出授权范围以及是否可能影响权利人的正常利益。

 

三、数据竞争与不正当竞争风险


近年来,司法实践已不再仅关注数据本身是否公开,而是更加关注数据获取方式是否正当、是否违反平台规则、是否破坏技术保护措施以及是否损害他人的合法数据权益。因此,对于企业而言,即使训练数据来源于互联网公开信息,也并不当然意味着可以无限制采集并用于模型训练。2025年修订的《中华人民共和国反不正当竞争法》首次将数据获取和使用行为纳入专门规制。


《中华人民共和国反不正当竞争法》第十三条规定:


经营者不得以欺诈、胁迫、避开或者破坏技术管理措施等不正当方式,获取、使用其他经营者合法持有的数据,损害其他经营者合法权益,扰乱市场竞争秩序。


该条并未禁止企业利用公开数据开展合法经营活动,而是强调数据获取方式的正当性。对于AI训练而言,企业不仅应关注训练数据是否公开,还应关注数据获取过程中是否绕过技术限制、违反平台规则或者损害数据持有人的合法竞争利益。


此外,《中华人民共和国反不正当竞争法》第二条确立了诚实信用原则和商业道德要求。即使数据获取行为未落入第十三条列举的不正当行为,若违反诚实信用原则、扰乱市场竞争秩序,仍可能构成不正当竞争。


实践中,互联网公开展示的数据并不意味着任何主体均可以无限制采集并用于商业化模型训练。司法机关和监管部门通常会综合考察以下因素判断数据获取行为是否合法:


(一)数据获取方式是否合法,是否采用爬虫程序、批量抓取、自动化采集等方式获取数据;

(二)是否违反网站服务协议、平台规则、robots协议、API调用规则或者其他访问限制;

(三)是否绕过登录验证、验证码、访问频率限制、反爬虫机制、付费墙等技术管理措施;

(四)数据是否属于其他经营者长期投入形成的具有经营价值的数据资源;

(五)训练数据的使用是否对原平台产品、数据服务或者商业模式形成实质性替代,是否造成流量分流、交易机会减少或者竞争优势受损;

(六)数据获取和利用行为是否损害消费者合法权益或者扰乱公平竞争秩序。

因此,判断AI训练数据是否合法,并非简单依据“是否公开”或者“是否可以访问”,而应结合数据来源、获取方式、技术措施、合同约定及后续使用方式进行综合评价。

 

四、企业AI训练数据全链条合规框架


AI训练数据合规应贯穿数据采集、数据处理、数据入库、数据存储及持续治理全生命周期。企业应围绕数据来源合法、处理过程合规、使用权限可控、全程可追溯及风险可持续管理等目标,建立覆盖训练数据全生命周期的治理体系。


(一)数据采集阶段


1.建立训练数据来源审查制度;

2.审查数据来源、授权依据、许可范围及使用限制;

3.对互联网抓取、API获取、第三方采购等不同获取方式开展合规评估;

4.建立第三方数据采购管理机制;

5.涉及用户输入数据、客户上传文件或企业知识库训练的,应通过隐私政策、产品界面或合同明确训练用途、共享范围、退出机制及删除规则;

6.建立数据来源台账,留存数据来源、授权文件及采集记录。

 

(二)数据处理阶段


1.建立训练数据分类分级制度;

2.对训练数据开展个人信息、知识产权、违法不良信息及数据质量审查;

3.对涉及个人信息的数据开展合法性基础审查;

4.建立训练数据权利清洗机制;

5.建立数据标注管理制度;

6.对高风险模型增加数据投毒、异常样本、对抗样本及模型记忆风险检测。

 

(三)数据入库阶段


1.建立训练数据准入制度;

2.建立训练数据分类标签体系;

3.建立元数据登记制度;

4.建立训练数据版本管理和数据血缘(Data Lineage)机制;

5.建立访问控制机制;

6.建立隔离库、待审库及禁止入库清单。

 

(四)数据存储阶段


1.建立训练数据安全管理制度;

2.根据数据类别及授权期限设置合理保存期限;

3.定期开展权限复核、安全评估及异常访问监测;

4.持续评估数据出境合规义务;

5.建立数据存储安全事件响应机制。

 

(五)持续治理阶段


1.建立AI训练数据管理制度及内部审批机制;

2.建立训练数据定期审计和动态评估机制;

3.建立模型上线后的持续监测机制;

4.建立侵权投诉、监管问询及安全事件响应机制;

5.建立训练数据合规档案。

 

AI训练数据合规并非单一环节的管理要求,而是覆盖数据获取、处理、使用、存储及持续运营的全生命周期治理体系。企业应建立以来源合法、权利清晰、过程可控、全程可追溯、风险可持续管理为核心的训练数据治理机制,在满足监管要求的同时,为模型训练、优化及商业化应用提供持续、稳定的合规保障。

 

* 实习生陈奕帆对本文亦有贡献。


注释:

1.See “UK Founder Series: Leveraging AI for Business Growth in the UK”, Orrick: https://www.orrick.com/en/Insights/2023/09/Founder-Series-Leveraging-AI-for-Business-Growth-in-the-UK.

2.NIST, AI Risk Management Framework (AI RMF 1.0)(Govern、Map章节)

联系我们

北京 

北京市朝阳区东三环中路5号财富金融中心35-36层  

电话:+86 10 8587 9199 

上海 

上海市长宁区长宁路1133号长宁来福士广场T1办公楼37层

电话:+86 21 6289 8808 

深圳

广东省深圳市福田区金田路荣超经贸中心4801  

电话:+86 755 8273 0104

香港

香港中環皇后大道中16–18號新世界大廈1座17樓1710–1711室

电话:+852 2114 2208

天津 

天津市河西区郁江道14号观塘大厦1号楼17层

电话:+86 22 8756 0066

南京

江苏省南京市江宁区秣周东路12号7号楼知识产权大厦10层1006-1008室

电话:+86 25 8370 8988

郑州 

河南省郑州市金水区金融岛华仕中心B座2楼

电话:+86 371 8895 8789

呼和浩特

内蒙古呼和浩特市赛罕区绿地腾飞大厦B座15层

电话:+86 471 3910 106

昆明

云南省昆明市盘龙区恒隆广场11楼1106室

电话:+86 871 6330 6330

西安

陕西省西安市雁塔区翠华路500号佳和商务大厦A座26层07室

电话:+86 29 8931 3353

杭州 

浙江省杭州市西湖区学院路77号黄龙国际中心B座11层 

电话:+86 571 8673 8786

重庆

重庆市两江新区庆云路2号国金中心T6写字楼8层8-8

电话:+86 23 6752 8936

海口 

海南省海口市龙华区玉沙路5号国贸中心11楼

电话:+86 898 6850 8795

日本东京

日本国东京都港区虎之门一丁目1番18号HULIC TORANOMON BLDG.

电话:0081 3 3591 3796

加拿大爱德华王子岛省

加拿大爱德华王子岛省夏洛特顿市皇后街160号B座

电话:001 902 518 2988

阿联酋迪拜

阿联酋迪拜伊玛尔商业园1号楼505号

电话:971 52 8372673

  • 首页
  • 电话
  • 返回顶部