说一个我自己遇到的事。让 agent 提取一份 Word 文档里的批注,它很利索地完成了,输出看起来完整。我多看了一眼过程记录,发现它中途换了一个工具——不是我一直用的那个。提取结果对不对?大概率对。但“大概率”三个字,在法律工作里不够用。从那以后我加了一条规矩:用什么工具它自己选,但换工具之后必须复验,复验的结果比较过,下次直接指定工具。
这件事让我想明白一个更普遍的问题:我们对“AI 读了我的材料”这件事,太放心了。
流畅的答案,不等于读完了你的材料
丢给 AI 一包文件,它输出一份逻辑严密的分析,人很自然地默认:它读完了。实际上,输出流畅和输入完整是两回事。它可能没读到某些文件,可能读错了格式,可能对关键部分只扫了个大概。而所有这些缺口,都不会在答案里留痕——它照样说得头头是道。
对法律人来说,这个错觉格外危险,原因藏在我们文件的“出身”里。
程序员的世界几乎是给 AI 预备的:代码是文本,配置是文本,日志还是文本。而我们手里的东西,PDF、Word、扫描件、图纸、照片,加上政府部门的 tiff 公文,几乎全是二进制文件。AI 处理文本如鱼得水,处理二进制就得靠一层层转换,每一层转换都可能丢东西。法律工作又恰恰从“一大包文件”开始。这就是为什么同样一个 AI,写代码锋利得很,读案卷却常常露出破绽——不是它偷懒,是它的注意力天生偏爱文本,而我们的日常偏偏不是文本。
几个具体的坑
Word 文档是个压缩包。docx 本质上是一个 zip 文件包,AI 读写它都要经过解包、解析、重组。批注、修订、编号这些信息藏在包里的各个角落,不同的工具提取的完整度不一样。所以工具被偷偷换掉这件事才值得警惕:换个工具,就换了一套解析逻辑。
PDF 有没有文字层,是两码事。文字版 PDF 直接能读,扫描件里只是一张张图片,不过 OCR 就没有文字层可言。一包材料里混着两种 PDF 的时候,AI 读到的世界是不完整的,而它不会主动告诉你哪部分它没读到。
证据的形式细节,纯文本装不下。一个印章是红的还是黑的,可能决定这是原件的扫描件还是复印件的扫描件,注意义务不一样。一段录音的波形有没有被剪辑的痕迹,靠“内容摘要”看不出来。图纸更麻烦,目前还没有让 AI 靠谱读懂工程图纸的工具——我能做的是至少承认这个缺口存在,人工审核图纸的时候格外小心。
这些细节有一个共同点:它们都在内容之外。转成纯文本的那一刻,它们就丢了。而法律工作里,恰恰是这些“内容之外”的东西,常常决定证据的分量。
三个对策
第一,让 AI 先报告它读到了什么。文件清单、每份的页数、每份大概在讲什么。拿这个清单对着你的材料核一遍,对不上的地方就是缺口。这个动作很便宜,几十秒,能拦住大部分漏读。
第二,转换前置。反复要用的材料,提前统一转换成 AI 友好的文本格式,不要每次临时转。临时转换有个隐蔽的问题:不稳定。这次它选的转换方案信息全,下次可能换了个方案就有缺失。你以为自己在用同一条管线,其实没有。
第三,复验。特别是那些“看起来完成了”的任务——批注提取、格式转换、信息抽取。抽几处核对,尤其是涉及正文增删的改动。错误最喜欢藏的地方,就是“已完成”三个字下面。
留一个怀疑
我现在的习惯是,拿到 AI 的输出,先留一个怀疑:它真的读到了吗?这个怀疑不制造焦虑,它只是让多看一眼过程、多核一处细节这个动作变得顺理成章。
法律人这辈子都在核证据。对 AI 的输出,用同样的职业本能就够了——毕竟,它的答案本质上也是一份证人证言,采信之前,先核实。
作者简介: 陈石律师(主页 chenshi.ai),浙江海泰律师事务所副主任、高级合伙人、房地产与建设工程部主任,宁波市律师协会副秘书长、第七届宁波仲裁委员会仲裁员,聚焦建筑房地产、投融资、并购重组及商事争议解决。曾获多家法律媒体与专业机构认可,荣登 LegalOne 2025 中国区建工及房地产实务先锋 45 强、律新社 2025 年度管理合伙人 20 佳(华东),入选《商法》The A-List 法律精英,获评 ALB China 区域市场十五佳长三角地区律师新星,并获律新社 2024 年度并购领域品牌之星。长期为万科、华润置地、信达地产、保利置业、招商蛇口、中海地产等企业提供法律服务,承办“首宗百亿地王”“长春第一高楼”“台州第一高楼”等代表性项目,累计服务项目投资额超千亿。近年来持续推动 AI 与法律实务融合,强调以结构化方法打通技术逻辑、法律判断与商业场景;著有《赋能法律人:AI 底层思维与应用范式》,并在多地开展相关主题讲座与分享。