WEI INSIGHT
课程

哪些数据不能直接放进公开模型

先分类,再使用

wei-editor · 2026-05-18T09:00:00.000Z
一句话结论

客户隐私、商业机密、未公开财务与个人身份信息必须隔离;先分类分级,再决定能否使用 AI。

作者 wei-editor编辑 wei-editor审核 wei-reviewer发布 2026-05-18
分享

一句话原则:凡是「泄露后会让客户或公司受损」的数据,都不该直接进公开模型。这既是安全底线,也是合规要求。中国的《生成式人工智能服务管理暂行办法》要求提供者依法开展数据合规、内容安全与用户权益保护;欧盟《人工智能法案》(EU AI Act)按风险分级,对高风险系统要求数据治理与人工监督。只要你的企业涉及跨境业务或外资客户,这两套都要关注。

红区清单:绝对禁止直接进公开模型的数据

  • 客户个人身份信息(PII):姓名、电话、身份证号、人脸、地址——泄露一条就可能触发法律风险
  • 未公开财务与合同:报表、定价策略、未披露交易、并购意向——这是商业情报的核心资产
  • 核心商业机密:配方、源代码、算法参数、供应商底价、客户名单——一旦进模型就等于公开了
  • 员工敏感信息:薪酬、健康档案、绩效评语、背景调查——涉及劳动法和隐私保护

那这些场景还能用 AI 吗?三种安全路径

  1. 私有化部署:模型跑在自己的服务器上,数据不出企业内网。成本高一些,但红区数据只有这条路
  2. 脱敏 + 匿名化:去掉姓名、身份证号等标识信息后再输入。但注意——脱敏不够彻底的话仍有风险
  3. 字段级权限控制:限定谁能查询哪些字段,所有访问留审计日志。适合「内部知识库问答」等场景

中欧双轨合规速查

  • 中国:生成式 AI 服务提供者需进行安全评估、算法备案、内容审核。即使你是「使用者」而非「提供者」,如果用公开模型处理客户数据,也可能被视为提供者
  • 欧盟:AI Act 按风险分四级(不可接受/高风险/有限风险/最低风险)。高风险系统需数据治理、人工监督、透明度说明。违反罚款可达全球年营收的 7%
本周动作:数据分级三步
  • 列一张清单:公司有哪些类型的数据?(客户/财务/人事/运营/研发)
  • 每类标注「能否进公开模型」:能 / 脱敏后能 / 绝对不能
  • 「绝对不能」的类别,标注当前存储位置和访问权限——如果发现散落在各种 Excel 和共享盘里,这就是最大风险
问:用大厂的企业版就算安全了吗?
答:企业版通常会隔离数据、不用于训练,但你要看清条款:「是否用于改进模型」「数据留存多久」「是否出域」「出事谁负责」。看完这四条用红区清单再做一次内部确认——别因为是大厂就跳过。
问:我们不做海外业务,是不是不用管 EU AI Act?
答:如果你的客户有外资背景、或者你用的 AI 工具来自欧盟供应商、或者未来可能出海——建议提前了解。合规成本前置比事后罚款划算得多。
参考来源:国家网信办《生成式人工智能服务管理暂行办法》
参考来源:欧盟《人工智能法案》(EU AI Act)

参考来源(2

  • 1. 国家网信办《生成式人工智能服务管理暂行办法》一手官方
    发布主体:国家互联网信息办公室(CAC)
    使用政策:仅用事实
    《生成式人工智能服务管理暂行办法》自 2023 年 8 月 15 日起施行,要求提供者依法开展标注、训练数据合规、内容安全与用户权益保护;用于舆论属性或社会动员能力的服务需履行算法备案等义务。
    https://www.cac.gov.cn/2023-07/13/c_1690898327029107.htm
  • 2. 欧盟《人工智能法案》(EU AI Act)一手官方
    发布主体:European Commission
    使用政策:仅用事实
    EU AI Act 于 2024 年 8 月 1 日生效,按风险分级(禁止 / 高风险 / 有限风险 / 最小风险)逐步施加义务,对高风险系统要求风险管理、数据治理、人工监督与技术文档,部分条款在 2025–2026 年分阶段适用。
    https://artificialintelligenceact.eu/

延伸阅读

哪些数据不能直接放进公开模型 · WEI INSIGHT