越省事 Vieter
VIETNAM INDUSTRY BRIEFING

人工智能培训政策必须明确

2025 年 6 月,加州联邦法院裁定 Anthropic 使用数百万本盗版书籍来训练其大型语言模型是“具有变革性的,非常惊人”,这一裁决短暂稳定了人工智能行业......

核心摘要:2025 年 6 月,加州联邦法院裁定 Anthropic 使用数百万本盗版书籍来训练其大型语言模型是“具有变革性的,非常惊人”,这一裁决短暂稳定了人工智能行业......

人工智能培训政策必须明确
人工智能培训政策必须明确

两个月后,Anthropic 以 15 亿美元达成和解,这是一个实例,表明人工智能训练的合法性取决于来源,并且管道的每个阶段都有自己的风险。

越南正在从不同的起点观察。它没有合理使用原则,并且正在跨越三个不同的法律制度从头开始构建人工智能培训框架。

模型训练不是单一行为,而是一个管道,每个阶段都有其自身的监管影响。立法遵循了这种职能划分。科技部握笔人工智能法;公安部负责监督个人数据保护;文化、体育和旅游部负责管理版权。因此,似乎每个监管机构对整个培训流程都有不同的细微差别。

自 3 月份起生效的越南人工智能法明确将开发人员定义为设计、构建、训练、测试或微调全部或部分人工智能模型、算法或系统的人。法律承认培训是一项独特的活动。它没有做的是详细规范该活动。

实质性合规义务偏重于部署。高风险系统提供商必须维护风险管理措施,管理培训数据以确保质量,并保留技术文档,所有这些都是在系统进入市场时制定的。风险分类、透明度要求和问责义务主要取决于正在部署和使用的系统。

对于当今需要知道其训练流程是否合规的开发人员来说,人工智能法设定了框架,但将实质内容留给了其他制度。

《个人数据保护法》(PDPL)及其实施令第356/2025/ND-CP号对于人工智能培训有明确但不完整的规定。 356号令允许组织使用个人数据研发人工智能系统,但要求自始至终遵守个人数据保护法规。该尾随条件具有法律效力。

一些紧张局势仍未得到解决。 PDPL 的目的限制原则引发了二次使用问题:为一个目的收集的数据(例如患者入院记录或贷款申请数据),然后用于训练单独的人工智能模型,可能需要从未寻求过的新同意。

该框架将去识别化数据视为不属于 PDPL 的范围,这将大大简化培训流程,但 PDPL 和第 356 号法令都没有定义什么技术标准的去识别化是足够的,因为模型行为的重新识别风险是重大且有充分记录的。

第 356 号法令又增加了一个复杂因素。在推理输出可用于识别特定人员的情况下,这些输出本身被视为个人数据。经过合法去识别化数据训练的模型,如果能够记忆或重建个人模式,就可以生成落入 PDPL 范围内的输出。没有具体说明谁对该结果承担责任以及何时承担责任。

即将颁布的修订第 17/2023/ND-CP 号法令的法令提出了文本和数据挖掘例外,以实施《知识产权法》的最新修正案。由于它仍然是草案,其条款可能还会发生变化,但当前的文本提出了值得注意的问题。

修订后的法律允许使用合法可访问的作品进行人工智能培训,前提是这种使用不会不合理地损害权利人,且不区分商业或非商业。然而,该法令草案将例外限制于非商业目的。如果这一解读继续存在,该法令将比其实施的立法更具限制性。

该草案还要求人工智能系统的输出不能取代基础训练数据的市场,混淆了两个分析上独立的问题:训练数据是否合法用作输入,以及模型输出作为输出是否侵犯版权。将训练行为的合法性与未来模型输出的特征联系起来会在训练发生时造成实际上无法验证的情况。

这些条款是否能在起草过程中幸存还有待观察,但它们的存在标志着开发商尚无法制定计划的不确定性。