<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>敏感数据识别 on 文艺技术笔记</title>
        <link>https://wenyiblog.top/tags/%E6%95%8F%E6%84%9F%E6%95%B0%E6%8D%AE%E8%AF%86%E5%88%AB/</link>
        <description>Recent content in 敏感数据识别 on 文艺技术笔记</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <copyright>文艺技术笔记 | 软件工程师文艺</copyright>
        <lastBuildDate>Mon, 07 Sep 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://wenyiblog.top/tags/%E6%95%8F%E6%84%9F%E6%95%B0%E6%8D%AE%E8%AF%86%E5%88%AB/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>数据分类分级的自动化实现方案：基于大模型的敏感数据识别与打标实战</title>
        <link>https://wenyiblog.top/2026/09/data-classification-llm-automation/</link>
        <pubDate>Mon, 07 Sep 2026 10:00:00 +0800</pubDate>
        
        <guid>https://wenyiblog.top/2026/09/data-classification-llm-automation/</guid>
        <description>&lt;p&gt;数据分类分级是所有数据安全工作的起点。加密、脱敏、访问控制、审计、DLP，这些手段哪一个不需要先知道&amp;quot;这条数据到底有多敏感&amp;quot;？但一个尴尬的现实是：大多数企业连&amp;quot;家底&amp;quot;都摸不清——几万张表、上百万个字段，靠人工一个一个标注级别，既标不完，也标不准，更标不起。&lt;/p&gt;
&lt;p&gt;有句话说得好：凡是重复性、规则性强的脑力劳动，最终都会被自动化吃掉。数据分类分级这件事，恰恰站在这个临界点上。本文拆解一套&amp;quot;规则引擎 + 大模型&amp;quot;的自动化打标方案，重点讲大模型怎么把语义级的敏感数据识别这件事真正做起来。&lt;/p&gt;
&lt;h2 id=&#34;一为什么分类分级必须走向自动化&#34;&gt;&lt;a href=&#34;#%e4%b8%80%e4%b8%ba%e4%bb%80%e4%b9%88%e5%88%86%e7%b1%bb%e5%88%86%e7%ba%a7%e5%bf%85%e9%a1%bb%e8%b5%b0%e5%90%91%e8%87%aa%e5%8a%a8%e5%8c%96&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;一、为什么分类分级必须走向自动化
&lt;/h2&gt;&lt;p&gt;传统上，数据分类分级有三种做法，各有各的死穴：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;做法&lt;/th&gt;
					&lt;th&gt;死穴&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;人工盘点&lt;/td&gt;
					&lt;td&gt;字段海量、成本极高，且不同人标准不一、容易漏&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;正则规则引擎&lt;/td&gt;
					&lt;td&gt;只能识别&amp;quot;长什么样&amp;quot;（手机号、身份证号），对语义敏感的字段无能为力&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;数据字典白名单&lt;/td&gt;
					&lt;td&gt;依赖字段名规范，字段名一不规范（&amp;ldquo;备注&amp;quot;&amp;ldquo;扩展字段&amp;rdquo;）就漏判&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;先看规则引擎的边界。用正则匹配手机号、身份证号、银行卡号这类 PII（个人可识别信息），准确率可以做到接近 100%，速度也快。但问题在于：&lt;strong&gt;大量敏感信息不是靠&amp;quot;格式&amp;quot;识别，而是靠&amp;quot;语义&amp;quot;识别&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;比如一个字段叫 &lt;code&gt;patient_description&lt;/code&gt;，里面写的是&amp;quot;患者于 2024 年确诊恶性肿瘤，目前接受化疗&amp;rdquo;。这个字段既没有标准格式，也没有明显的 PII 模式，但它毫无疑问是敏感数据——个人健康信息。规则引擎面对它只能抓瞎。&lt;/p&gt;
&lt;p&gt;再比如一个 &lt;code&gt;contract_remark&lt;/code&gt; 字段，写的是&amp;quot;该供应商为某军工单位二级配套&amp;quot;。没有身份证号、没有手机号，但它是供应链敏感信息。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;规则引擎解决的是&amp;quot;已知的敏感长什么样&amp;quot;，大模型解决的是&amp;quot;没见过的敏感长什么样&amp;quot;。这两者必须配合，缺了谁都不完整。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id=&#34;二先把标准钉死分类分级框架是自动化的前提&#34;&gt;&lt;a href=&#34;#%e4%ba%8c%e5%85%88%e6%8a%8a%e6%a0%87%e5%87%86%e9%92%89%e6%ad%bb%e5%88%86%e7%b1%bb%e5%88%86%e7%ba%a7%e6%a1%86%e6%9e%b6%e6%98%af%e8%87%aa%e5%8a%a8%e5%8c%96%e7%9a%84%e5%89%8d%e6%8f%90&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;二、先把标准钉死：分类分级框架是自动化的前提
&lt;/h2&gt;&lt;p&gt;在谈大模型之前，必须先说清楚一件事：&lt;strong&gt;自动化打标，打的是什么标？标准从哪来？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;如果连&amp;quot;分几类、分几级、什么数据算敏感&amp;quot;都没定，大模型只能凭&amp;quot;感觉&amp;quot;打标，结果必然是各行其是。所以第一步是把分类分级框架定死，大模型只是这个框架的&amp;quot;执行者&amp;quot;。&lt;/p&gt;
&lt;p&gt;这里参考一份真实的行业规范（某大型汽车集团的数据分类分级标准，已脱敏），它的框架可以直接抄：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;三大数据类&lt;/strong&gt;：企业数据、个人信息、车联网数据（车企特有，其他行业换成自己的业务域即可）。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;六级分级&lt;/strong&gt;，由低到高：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;级别&lt;/th&gt;
					&lt;th&gt;名称&lt;/th&gt;
					&lt;th&gt;定义要点&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;1级&lt;/td&gt;
					&lt;td&gt;公开数据&lt;/td&gt;
					&lt;td&gt;可对外公开发布、转发传播&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;2级&lt;/td&gt;
					&lt;td&gt;内部共享数据&lt;/td&gt;
					&lt;td&gt;泄露对个人/组织权益造成一般危害，内部及关联方可共享&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;3级&lt;/td&gt;
					&lt;td&gt;授权共享数据&lt;/td&gt;
					&lt;td&gt;泄露造成严重危害，内部授权后访问，外发需审批脱敏&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;4级&lt;/td&gt;
					&lt;td&gt;限制分发数据&lt;/td&gt;
					&lt;td&gt;泄露造成特别严重危害，建立授权控制列表严格管控&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;5级&lt;/td&gt;
					&lt;td&gt;重要数据&lt;/td&gt;
					&lt;td&gt;泄露直接危害国家安全（一般危害），按法律法规认定&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;6级&lt;/td&gt;
					&lt;td&gt;核心数据&lt;/td&gt;
					&lt;td&gt;泄露危害国家安全（严重/特别严重危害），按法律法规认定&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;blockquote&gt;
&lt;p&gt;5级、6级对应国家层面&amp;quot;重要数据、核心数据&amp;quot;，由监管认定，企业基本不碰；内部主要精力花在 1-4 级的一般数据上。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这份规范里有一条原则，对自动化打标&lt;strong&gt;至关重要&lt;/strong&gt;——&lt;strong&gt;就高从严原则&lt;/strong&gt;：当多个因素可能影响分级时，按可能造成的最高影响程度确定级别。&lt;/p&gt;
&lt;p&gt;翻译成工程语言就是：&lt;strong&gt;大模型打标宁高勿低，模棱两可时取高级别&lt;/strong&gt;。这直接决定了后面 Prompt 和判定逻辑怎么设计。&lt;/p&gt;
&lt;p&gt;还有一组概念是判定的&amp;quot;打分表&amp;quot;——&lt;strong&gt;分级要素&lt;/strong&gt;：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;影响对象&lt;/th&gt;
					&lt;th&gt;影响程度&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;国家安全 / 经济运行 / 社会秩序 / 公共利益 / 组织个人权益&lt;/td&gt;
					&lt;td&gt;特别严重 / 严重 / 一般 / 无危害&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这个二维矩阵，就是大模型做判定时脑子里要装的东西。&lt;/p&gt;
&lt;h2 id=&#34;三方案设计规则引擎--大模型的两层架构&#34;&gt;&lt;a href=&#34;#%e4%b8%89%e6%96%b9%e6%a1%88%e8%ae%be%e8%ae%a1%e8%a7%84%e5%88%99%e5%bc%95%e6%93%8e--%e5%a4%a7%e6%a8%a1%e5%9e%8b%e7%9a%84%e4%b8%a4%e5%b1%82%e6%9e%b6%e6%9e%84&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;三、方案设计：规则引擎 + 大模型的两层架构
&lt;/h2&gt;&lt;p&gt;单靠大模型不经济——每条都调模型，慢且贵；单靠规则引擎不全面——语义敏感抓不到。所以落地的架构是两层：&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;
&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;3
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;4
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-fallback&#34; data-lang=&#34;fallback&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;数据字段 → 第一层：规则引擎（正则 PII 识别）
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;                ├─ 命中 → 直接定级，不走模型
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;                └─ 未命中 → 第二层：大模型语义识别
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;                              └─ 输出 级别 + 依据 + 置信度
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;h3 id=&#34;第一层规则引擎兜底&#34;&gt;&lt;a href=&#34;#%e7%ac%ac%e4%b8%80%e5%b1%82%e8%a7%84%e5%88%99%e5%bc%95%e6%93%8e%e5%85%9c%e5%ba%95&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;第一层：规则引擎兜底
&lt;/h3&gt;&lt;p&gt;用正则 + 数据字典覆盖&amp;quot;格式可识别&amp;quot;的敏感数据：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;类型&lt;/th&gt;
					&lt;th&gt;识别方式&lt;/th&gt;
					&lt;th&gt;定级&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;手机号 / 身份证 / 银行卡 / 邮箱&lt;/td&gt;
					&lt;td&gt;正则匹配&lt;/td&gt;
					&lt;td&gt;4级（敏感个人信息）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;姓名、证件号、家庭住址&lt;/td&gt;
					&lt;td&gt;数据字典 + 正则&lt;/td&gt;
					&lt;td&gt;3-4级&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;内部字段名白名单（薪资、绩效、密钥）&lt;/td&gt;
					&lt;td&gt;字段名匹配&lt;/td&gt;
					&lt;td&gt;4级&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;第一层命中的，直接定级，不进大模型，省钱又省时间。这一层能覆盖的，往往是&amp;quot;大头&amp;quot;——在一个真实盘点里，PII 类字段常常占敏感字段的六七成。&lt;/p&gt;
&lt;h3 id=&#34;第二层大模型语义识别&#34;&gt;&lt;a href=&#34;#%e7%ac%ac%e4%ba%8c%e5%b1%82%e5%a4%a7%e6%a8%a1%e5%9e%8b%e8%af%ad%e4%b9%89%e8%af%86%e5%88%ab&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;第二层：大模型语义识别
&lt;/h3&gt;&lt;p&gt;第一层漏掉的——那些靠语义判断的敏感字段——交给大模型。这是本文的重点，下面展开。&lt;/p&gt;
&lt;h2 id=&#34;四大模型打标的关键实现&#34;&gt;&lt;a href=&#34;#%e5%9b%9b%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%89%93%e6%a0%87%e7%9a%84%e5%85%b3%e9%94%ae%e5%ae%9e%e7%8e%b0&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;四、大模型打标的关键实现
&lt;/h2&gt;&lt;h3 id=&#34;41-识别粒度字段级为主&#34;&gt;&lt;a href=&#34;#41-%e8%af%86%e5%88%ab%e7%b2%92%e5%ba%a6%e5%ad%97%e6%ae%b5%e7%ba%a7%e4%b8%ba%e4%b8%bb&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;4.1 识别粒度：字段级为主
&lt;/h3&gt;&lt;p&gt;实践证明，&lt;strong&gt;字段级&lt;/strong&gt;是最优粒度——给模型一个&amp;quot;字段名 + 字段注释 + 采样值&amp;quot;，让它判断这个字段的级别。表级太粗（一张表可能混着各种级别的字段），记录级太细（成本高、且逐条判断不稳定）。&lt;/p&gt;
&lt;p&gt;字段级识别的输入构造：&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;
&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;3
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;4
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-fallback&#34; data-lang=&#34;fallback&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;字段名：patient_description
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;字段注释：患者病情描述
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;采样值：[&amp;#34;患者于2024年确诊恶性肿瘤，接受化疗中&amp;#34;, ...]
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;→ 大模型判断：个人健康信息，敏感个人信息，4级
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;h3 id=&#34;42-prompt-设计把标准喂进去&#34;&gt;&lt;a href=&#34;#42-prompt-%e8%ae%be%e8%ae%a1%e6%8a%8a%e6%a0%87%e5%87%86%e5%96%82%e8%bf%9b%e5%8e%bb&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;4.2 Prompt 设计：把标准喂进去
&lt;/h3&gt;&lt;p&gt;大模型不会凭空知道你的分级标准，必须把框架喂进去。Prompt 三要素：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;角色设定&lt;/strong&gt;：你是一名数据安全分级专家&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;标准注入&lt;/strong&gt;：把六级定义、就高从严原则、分级要素矩阵贴进去&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;few-shot 示例&lt;/strong&gt;：给 3-5 个标注好的例子，让模型学会判断口径&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;few-shot 的设计有个关键：&lt;strong&gt;示例要覆盖&amp;quot;容易误判&amp;quot;的边界 case&lt;/strong&gt;，比如：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&amp;ldquo;备注&amp;quot;字段（名不副实，可能藏着敏感信息）&lt;/li&gt;
&lt;li&gt;&amp;ldquo;年龄&amp;quot;字段（看似敏感，其实一般是 2-3 级的一般个人信息）&lt;/li&gt;
&lt;li&gt;衍生字段（聚合后的统计值，级别可能降）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这几个例子能让模型在判断时&amp;quot;拿捏&amp;quot;住尺度，而不是见什么敏感词就往 4 级上靠。&lt;/p&gt;
&lt;h3 id=&#34;43-结构化输出--置信度&#34;&gt;&lt;a href=&#34;#43-%e7%bb%93%e6%9e%84%e5%8c%96%e8%be%93%e5%87%ba--%e7%bd%ae%e4%bf%a1%e5%ba%a6&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;4.3 结构化输出 + 置信度
&lt;/h3&gt;&lt;p&gt;让模型输出结构化 JSON，而不是自由文本：&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;
&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;3
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;4
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-json&#34; data-lang=&#34;json&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;p&#34;&gt;{&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;  &lt;span class=&#34;nt&#34;&gt;&amp;#34;level&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;:&lt;/span&gt; &lt;span class=&#34;mi&#34;&gt;4&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;  &lt;span class=&#34;nt&#34;&gt;&amp;#34;reason&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;:&lt;/span&gt; &lt;span class=&#34;s2&#34;&gt;&amp;#34;字段含个人健康信息，属敏感个人信息，按就高从严定为4级&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;  &lt;span class=&#34;nt&#34;&gt;&amp;#34;confidence&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;:&lt;/span&gt; &lt;span class=&#34;mf&#34;&gt;0.92&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;p&#34;&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;code&gt;confidence&lt;/code&gt; 是人工审核的开关：&lt;strong&gt;置信度低于阈值（如 0.85）的，转人工复核&lt;/strong&gt;。这既保证了效率，又兜住了大模型&amp;quot;幻觉&amp;quot;的风险。&lt;/p&gt;
&lt;h3 id=&#34;44-就高从严的工程化&#34;&gt;&lt;a href=&#34;#44-%e5%b0%b1%e9%ab%98%e4%bb%8e%e4%b8%a5%e7%9a%84%e5%b7%a5%e7%a8%8b%e5%8c%96&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;4.4 就高从严的工程化
&lt;/h3&gt;&lt;p&gt;模型有时会给出&amp;quot;3级或4级&amp;quot;这种模糊判断。工程上直接把&amp;quot;就高从严&amp;quot;编码进判定逻辑：&lt;strong&gt;只要模型提及可能达到更高危害，就取高级别&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;这个取舍背后是一笔账：与其漏标一个敏感字段（酿成泄露事故），不如多标一个、让业务方复核后降级。安全领域的&amp;quot;错杀&amp;quot;成本远低于&amp;quot;漏放&amp;quot;成本。&lt;/p&gt;
&lt;h2 id=&#34;五落地流程从资产盘点到持续运营&#34;&gt;&lt;a href=&#34;#%e4%ba%94%e8%90%bd%e5%9c%b0%e6%b5%81%e7%a8%8b%e4%bb%8e%e8%b5%84%e4%ba%a7%e7%9b%98%e7%82%b9%e5%88%b0%e6%8c%81%e7%bb%ad%e8%bf%90%e8%90%a5&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;五、落地流程：从资产盘点到持续运营
&lt;/h2&gt;&lt;p&gt;自动化打标不是跑一次就完事，要嵌入持续运营：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;资产盘点&lt;/strong&gt;：从数据目录（Data Catalog）拉出全量字段清单&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;批量打标&lt;/strong&gt;：规则引擎 + 大模型逐字段判定&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;人工校准&lt;/strong&gt;：低置信度字段 + 抽检，人工复核修正&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;结果落库&lt;/strong&gt;：分级结果写回数据目录，供下游安全组件读取&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;动态更新&lt;/strong&gt;：业务变化、新表上线时增量打标&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这里要强调一点：&lt;strong&gt;第一版准确率到 70-80% 就够了，先跑起来再校准&lt;/strong&gt;。很多项目死在&amp;quot;追求一次性 100% 准确&amp;quot;上，迟迟不敢上线，最后什么都没落地。数据分类分级是&amp;quot;越用越准&amp;quot;的事，不是&amp;quot;一步到位&amp;quot;的事。&lt;/p&gt;
&lt;h2 id=&#34;六实测效果与几个坑&#34;&gt;&lt;a href=&#34;#%e5%85%ad%e5%ae%9e%e6%b5%8b%e6%95%88%e6%9e%9c%e4%b8%8e%e5%87%a0%e4%b8%aa%e5%9d%91&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;六、实测效果与几个坑
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;效果&lt;/strong&gt;（一个中型企业的体量，几万个字段）：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;指标&lt;/th&gt;
					&lt;th&gt;数值&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;PII 类（规则引擎覆盖）准确率&lt;/td&gt;
					&lt;td&gt;接近 100%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;语义敏感类（大模型覆盖）准确率&lt;/td&gt;
					&lt;td&gt;85-90%，人工复核后 95%+&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;成本&lt;/td&gt;
					&lt;td&gt;字段级调用，远低于人工盘点&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;踩过的坑&lt;/strong&gt;：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;坑&lt;/th&gt;
					&lt;th&gt;现象&lt;/th&gt;
					&lt;th&gt;解法&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;字段名误导&lt;/td&gt;
					&lt;td&gt;&amp;ldquo;备注&amp;quot;&amp;ldquo;扩展字段&amp;quot;名不副实，藏着敏感信息&lt;/td&gt;
					&lt;td&gt;采样值必须喂给模型，不能只看字段名&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;过度定级&lt;/td&gt;
					&lt;td&gt;模型把&amp;quot;年龄&amp;quot;&amp;ldquo;性别&amp;quot;也定成 4 级，数据可用性受损&lt;/td&gt;
					&lt;td&gt;few-shot 里加降级示例，明确&amp;quot;一般个人信息 2 级&amp;rdquo;&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;幻觉定级&lt;/td&gt;
					&lt;td&gt;模型编造&amp;quot;这是国家级重要数据&amp;rdquo;&lt;/td&gt;
					&lt;td&gt;限定只在 1-4 级内判断 + 置信度阈值 + 人工复核&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;衍生数据漏判&lt;/td&gt;
					&lt;td&gt;聚合后的统计数据被当普通数据&lt;/td&gt;
					&lt;td&gt;单独处理衍生字段，参考原始数据级别&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id=&#34;回到开头那个问题&#34;&gt;&lt;a href=&#34;#%e5%9b%9e%e5%88%b0%e5%bc%80%e5%a4%b4%e9%82%a3%e4%b8%aa%e9%97%ae%e9%a2%98&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;回到开头那个问题
&lt;/h2&gt;&lt;p&gt;数据分类分级这件事，为什么过去十年做了又废、废了又做？根子在于它一直被当成一个&amp;quot;一次性的咨询项目&amp;rdquo;——请人盘点一次，出了份《分级规范》文档，三个月后字段一变化，又回到原点。&lt;/p&gt;
&lt;p&gt;大模型的价值，不在于它比人&amp;quot;聪明&amp;quot;多少，而在于它把&amp;quot;分类分级&amp;quot;从一次性的专家动作，变成了一个&lt;strong&gt;可以随业务持续运行的自动化能力&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;标准钉死、规则兜底、大模型补语义、人工校置信度——这套组合跑通之后，分类分级才真正从&amp;quot;写在纸上的规范&amp;rdquo;，变成&amp;quot;活在系统里的能力&amp;rdquo;。而这，恰恰是它该有的样子。&lt;/p&gt;
</description>
        </item>
        
    </channel>
</rss>
