怎么用敏感数据做 AI,同时不让数据离开你的公司。
法律眼里的「敏感」是什么、这类数据进入 AI 流程后有什么变化,以及那套从头到尾把个人身份标识留在你环境内部的架构。
一句话的答案。
越过边界的是这个案子,不是这个人。任何东西出去之前,身份标识先被换成一个内部键;键和人的对应关系放在客户环境内部的一张表里;模型的结果回来之后,在里面重新关联。在外面那一侧,任何时刻都没有办法反推到具体是谁。
这不是一条拖慢项目的限制:它恰恰是让项目能被批下来的东西。在 AI 真正有用的大多数场景里 —— 初审、分类、排序、摘要 —— 模型并不需要知道这个案子是谁的才能做对。它需要的是案子的事实。
这篇文章不是法律意见。它讲的是架构,并附上官方来源的链接引用 LGPD 原文。你自己案子的法律判断属于你的法务或数据保护负责人,而架构必须和那份判断一起设计。
决定这个项目的三段 LGPD 条文。
每一条都给出中文译文,并把葡萄牙语原文附在下面 —— 因为改写法条正是错误钻进来的地方,而中文译文没有法律效力。Lei nº 13.709/2018 的完整文本在巴西政府 Planalto 网站上,链接在本页末尾。
「敏感个人数据:关于种族或民族出身、宗教信仰、政治观点、工会成员身份或宗教、哲学、政治性组织成员身份的个人数据,涉及健康或性生活的数据,基因或生物识别数据,当其与一个自然人相关联时。」
原文:“dado pessoal sensível: dado pessoal sobre origem racial ou étnica, convicção religiosa, opinião política, filiação a sindicato ou a organização de caráter religioso, filosófico ou político, dado referente à saúde ou à vida sexual, dado genético ou biométrico, quando vinculado a uma pessoa natural”
注意句子的最后半句:当其与一个自然人相关联时。边界架构在数据出去之前拆掉的,正是这个关联。
「匿名数据在本法意义上不视为个人数据,但当其所经过的匿名化过程被仅凭自有手段还原,或者能以合理努力还原时,不在此限。」
原文:“Os dados anonimizados não serão considerados dados pessoais para os fins desta Lei, salvo quando o processo de anonimização ao qual foram submetidos for revertido, utilizando exclusivamente meios próprios, ou quando, com esforços razoáveis, puder ser revertido.”
这是没有哪个项目会读、直到出事才读的一段。匿名化不是盖个章:只要能以合理努力回到那个人,这份数据依然是个人数据。
「数据处理主体应当采取技术和管理上的安全措施,以保护个人数据免遭未授权访问,以及意外或非法的销毁、丢失、篡改、传播,或任何形式的不当或非法处理。」
原文:“Os agentes de tratamento devem adotar medidas de segurança, técnicas e administrativas aptas a proteger os dados pessoais de acessos não autorizados e de situações acidentais ou ilícitas de destruição, perda, alteração, comunicação ou qualquer forma de tratamento inadequado ou ilícito.”
法律强制要有措施,但不列出是哪些。写这份清单的是项目本身 —— 所以这条边界必须落在一份文档里,不能只落在代码里。
边界架构,五步。
这就是 Moonxi 在医疗领域运营的那套架构:患者的身份标识不越过医院环境的边界。这个模式对任何不能外流的数据都成立。
先分类,再搬动
把「个人数据」「法律定义下的敏感个人数据」和「两者都不是」分开。这个划分不写下来,后面每一个决定都只是意见。
把边界画进一张图里
一条线,两边:哪些留在客户环境里,哪些可以出去。个人的身份标识留在里面这一侧。安全团队要评审的是这张图,不是代码。
用内部键替换身份标识
越过边界的是这个「案子」,不是这个人。客户环境内部的一张镜像表保存内部键和真实身份标识的对应关系,而这张表一步都不出去。
权限在检索这一步生效,不在提示词里
谁能看什么,在任何片段送到模型之前就筛掉。拜托模型「别透露」,是一种建立在善意之上的访问控制。
记录访问,并且把回程也测一遍
谁查的、什么时候查的、查的是哪个案子。然后反过来测:拿着结果、又没有那张镜像表,能不能反推到具体的人?如果能,这条边界就不存在。
上云不会把责任转移出去。它只是把责任切成两半。
AWS 的责任共担模型写得很明白,而通常把公司打个措手不及的是下面那一半。
云本身的安全
保护运行这些服务的基础设施:硬件、软件、网络和物理设施。
云里面的安全
管理你自己的数据(包括加密选项)、对你的资产分类,并用身份与访问工具施加正确的权限。
翻译到项目上:没有哪家云厂商会替你给数据分类、替你定谁能看什么、替你决定什么可以离开你的环境。这三个决定仍然是你的 —— 而这篇指南讲的正是它们。
关于敏感数据和 AI 的问题。
LGPD 说的「敏感个人数据」指什么?
Lei nº 13.709/2018 第 5 条第 2 项把敏感个人数据定义为:关于种族或民族出身、宗教信仰、政治观点、工会或宗教、哲学、政治性组织成员身份的个人数据,涉及健康或性生活的数据,以及基因或生物识别数据 —— 前提是它与一个自然人相关联。
匿名化之后还算个人数据吗?
第 12 条说,匿名数据在本法意义上不视为个人数据,但附了一个很大的但书:除非该匿名化过程被仅凭自有手段还原,或者能以合理努力还原。也就是说,匿名化不是一个按钮 —— 它是一种此后必须持续成立的属性。
能不能在数据不出公司的前提下用 AI?
能,而且数据敏感时这就是标准架构。越过边界的是「不带人的案子」:身份标识被换成一个内部键,对应关系放在你环境内部的一张表里,结果回来之后在里面重新关联。
我用云的时候,安全责任归谁?
是分开的。AWS 声明自己负责保护运行这些服务的基础设施 —— 硬件、软件、网络和设施。客户负责云里面的安全:管理自己的数据(包括加密选项)、对自己的资产分类,并使用身份与访问工具施加正确的权限。
法律在安全上要求什么?
第 46 条要求数据处理主体采取技术和管理上的安全措施,以保护个人数据免遭未授权访问,以及意外或非法的销毁、丢失、篡改、传播,或任何不当或非法的处理。法律没有列出具体措施:这份清单是由项目来写的。
这算法律意见吗?
不算。这篇指南讲的是架构,并附上官方来源的链接引用法条原文。你自己案子的法律判断,属于你的法务或数据保护负责人,而架构必须和那份判断一起设计,不是在它之后。
资料来源
三段法条的葡萄牙语原文抄自 Planalto 网站上的官方文本,责任共担模型来自 AWS 的页面。两份资料都在 2026 年 8 月 9 日打开核对过。中文译文由我们自己翻译,仅供阅读;有法律效力的是葡萄牙语原文。