先给结论:要把案卷材料脱敏后再交给 AI 处理,就别把材料上传给任何云端大模型去脱敏。这个动作本身自相矛盾——脱敏的目的是让材料不出你的本机,而你把它发出去的那一刻,目的已经落空了。
这不是抬杠。替你处理材料的云端模型在厂商的服务器上运行,你的文件要先完整地传过去,它才“看得见”。用一个需要你先交出材料的服务,去实现“材料不外流”,逻辑上就不成立。
那正确的路子是什么?把我自己反复测试、还在继续迭代的几条路线摆出来,供同行参考。
先分清两类信息
脱敏的对象其实是两种东西,处理方式完全不同。
有结构规律的字段:身份证号、手机号、统一社会信用代码、案号。这类信息的字符构成有固定模式,用正则表达式(一种文本模式匹配规则)就能批量识别、批量替换,脚本一跑,整包文件处理完,快且稳定。
没有规律的字段:自然人姓名、项目名称、地名。这些就是普通词组,正则抓不住。要处理它们,得先有一份“对照字典”(哪个名字替换成哪个代号),然后按字典逐个查找替换。
脱敏的全部难点,几乎都集中在第二类。字典怎么来,就是路线之争。
四条路线的真实成色
路线一:手搓词典。每个案子自己动手,把人名、项目名整理成对照表,再让脚本执行。可控性最好,问题是累。每个案件的人都不同,每个案子都要重做一遍词典。案子一多,这条路走不动。
路线二:NER 模型。NER(命名实体识别)是一类专门识别人名、机构名、地名的传统小模型,能力专一,资源占用低。听起来是对症下药,实际有两个坑:一是它的能力完全由训练语料决定——拿新闻语料训练的模型,对付新闻稿很顺手,放到格式、用语完全不同的法律文书上,识别率明显下滑;二是中文法律场景的现成开源模型不好找,找到也未必贴合你的文书类型。
路线三:云端大模型。能力最强,但前面说了,前提矛盾,直接排除。
路线四:本地部署的大模型。在自己电脑上跑一个小参数量的模型,数据不出本机,理解能力又远超 NER。短板是慢——本地硬件跑大模型,吞吐量有限,让它逐份处理几十上百个文件,时间成本很高。
我现在的组合:模型出字典,脚本干粗活
把路线四和脚本结合起来,短板就互补了。
具体做法:从整包材料里挑一两个有代表性的文件,交给本地模型,只让它干一件事——把这份文件里需要脱敏的人名、项目名、机构名全部提炼出来,生成一份对照字典。这一步它擅长,而且只处理一两个文件,再慢也慢不到哪里去。
字典拿到手之后,剩下的工作全部交给脚本:正则规则处理有规律的字段,字典处理人名和项目名,整包文件批量跑完。脚本不吃算力、不会幻觉、一分钟跑完的东西,没必要让模型逐份去读。
模型负责“认出来”,脚本负责“替换掉”,各干各的。这是目前我测下来效果和效率平衡得最好的组合。
三条纪律
脱敏不能破坏证据形式。材料将来可能要作为证据使用,转换和替换过程中,别动文件的结构性信息——哪份文件、什么格式、页码关系,都要能对回原件。所以原始文件永远不动,脱敏在副本上做,两边保留对应关系。
机器脱敏完,人工必须复核。任何自动替换都可能漏、可能错。抽核的办法很简单:在脱敏后的文件里全文搜索当事人姓名和相关项目名,搜不到才算过关;再抽查几处替换点,确认没有把不该换的内容换掉。
想清楚“敏感”的边界。有些材料的问题不在姓名,而在事实组合——行业、地域、纠纷类型凑在一起,即使隐去姓名也能对号入座。这类材料该调的不只是字段,还有细节颗粒度。这一步机器帮不了你,得靠执业判断。
写在最后
这套组合里最值得投入的一步,是把“提炼词典”这个动作固定成你自己的一条流水线:代表文件进,对照字典出。第一次搭要花点功夫,之后每个新案子都是复用。
律师的保密义务,不允许我们把原始材料随意交给不可控的云端第三方。好消息是,把本地模型和几个脚本串起来,数据不出本机的处理流程,今天已经完全可以搭出来了。
作者简介: 陈石律师(主页 chenshi.ai),浙江海泰律师事务所副主任、高级合伙人、房地产与建设工程部主任,宁波市律师协会副秘书长、第七届宁波仲裁委员会仲裁员,聚焦建筑房地产、投融资、并购重组及商事争议解决。曾获多家法律媒体与专业机构认可,荣登 LegalOne 2025 中国区建工及房地产实务先锋 45 强、律新社 2025 年度管理合伙人 20 佳(华东),入选《商法》The A-List 法律精英,获评 ALB China 区域市场十五佳长三角地区律师新星,并获律新社 2024 年度并购领域品牌之星。长期为万科、华润置地、信达地产、保利置业、招商蛇口、中海地产等企业提供法律服务,承办“首宗百亿地王”“长春第一高楼”“台州第一高楼”等代表性项目,累计服务项目投资额超千亿。近年来持续推动 AI 与法律实务融合,强调以结构化方法打通技术逻辑、法律判断与商业场景;著有《赋能法律人:AI 底层思维与应用范式》,并在多地开展相关主题讲座与分享。