← 文章 / AI技术
胡律用AI 7小时前 · 2026-09-13 15:12:03 · 3 阅读

本地AI校对律师文书,不输云端大模型?实测结果意外

胡律用AI / 律师视角的法律AI评测实验室

Vol.022|本地AI校对实测

说明|测试时间点:2026年8月12日晚。试卷、封存答案、提示词与Vol.021完全相同,各跑一次不追问;唯一变量是考生换成我Mac里的两个本地模型。分数只代表这次测试。案情沿用本系列虚构教学材料

上期那份埋了10处错的起诉状,云端Kimi校出满分。满分有个前提:把文书全文粘进别人家的服务器。教学案例无所谓,真实案件的材料,多数律师过不了保密这一关。这期把同一张卷子交给装在我自己电脑里的模型——文书不出本机,看能考几分。

一、怎么测

试卷没动:还是那10处埋错,法律坑5处、交叉对照坑4处、计算坑1处,答案清单上期封存至今。提示词也没动,还是上期那句一键校对指令,一字未改。

换的只有考生。两个模型都装在我的Mac上,通过omlx调用——这是一个本地模型服务,只在本机之内运行,推理不需要联网。这台电脑上的本地模型平时干离线OCR和语音转写的活,测试用的就是现役配置。

考生体积档位
Qwen3.6-35B(4bit量化19GB本地主力档
Qwen3-VL-4B(4bit量化2.9GB16GB内存的普通电脑也能跑的轻量档(视觉模型客串)
二、总分:本地云端放进同一张表
排名考生总分/10误报
1Kimi(云端)100
2豆包(云端)9.50
2Qwen3.6-35B(本地)9.50
4千问(云端)90
5DeepSeek(云端)6.50
6Qwen3-VL-4B(本地)4.52
考生法律坑/5交叉坑/4计算坑/1
Kimi(云端)541
豆包(云端)4.541
Qwen3.6-35B(本地)4.541
千问(云端)441
DeepSeek(云端)4.520
Qwen3-VL-4B(本地)2.51.50
三、35B:并列第二,只输Kimi半分

逐项对下来,35B的卷面挑不出大毛病。管辖坑答出海珠或天河两个正确选项,引到民诉法解释第18条。上期千问唯一漏掉的律师费,它抓到了,还给出两套处理:借条有约定就补进事实陈述,没约定就删掉这项诉请。差1000元的算术错,它把算式重新验了一遍,指出三处数字要联动改。误报为零——答案清单里预留的8个争议点,先息后本抵充、逾期利息起算日这些正确处理,它一个没碰。

有个细节值得单说。云端千问上期9分,这次装在我电脑里的Qwen3.6拿9.5分,同一家出的模型,本地这个多拿半分(云端那次是思考·研究模式,联网状态未留证,比较口径放宽看)。

它唯一丢的半分,和云端DeepSeek丢在同一处:按月利率2%主张的逾期利息,它看出年化24%超了司法保护上限,没看出借条压根没约定过逾期利率,给的改法停在按LPR四倍计算。上期讲过,这个案子能主张的只有借条约定的0.8%。前后六个考生,把这一处完整改对的只有Kimi。

四、4B:崩了,崩得还很有形状

4.5分垫底。管辖、账户尾号、借条出具日、1000元算术错,全漏。还倒贴两处误报:把先立据、五天后放款说成严重事实错误;把9月底借款人请求宽限、次年1月发律师函这段正常时间线,说成时间上不可能。

替它说明一句:VL是视觉语言模型,本职是看图,文字分析不是它的主业。派它上场,看中的是2.9GB的体积——16GB内存的电脑装得下,我手头现成的就是它。所以这4.5分只够说明一件事:不对口的轻量模型别拿来校文书。同体积的纯文本小模型什么水平,这次没测,不下结论。

最值得留截图的是它改废止法条的方式。它建议改引民法典,然后开始列条文:第六百六十七条、第六百七十五条……列着列着刹不住,一路编到九千多条。民法典一共1260条。它顶着这份编造的条文清单撞上输出上限,被硬生生截断,前半篇内容还重复输出了一遍。

小模型漏得多,编起来也比云端更野。防幻觉是本系列的老话题(Vol.004、005),这算是最直观的一次现场演示。

五、这次测出的边界

别再问本地AI行不行,要问哪一档才行。同一台电脑,19GB的文本主力考9.5分2.9GB的视觉模型客串上场,考4.5分还倒贴两处误报。保密有代价,代价是硬件:跑得动大杯,本地校对可以进工作流;只跑得动轻量档,先看清模型对不对口,再决定让不让它碰文书。

第二条,本地模型的知识停在训练截止那天,停得比云端更死。35B在思考过程里引用的LPR是训练语料时点的数字,当下是多少它无从核对。要查最新法条、新司法解释的活,别派给它。

第三条,速度顾虑可以放下。35B交这份完整校对意见用了79秒,比4B还快了近五分钟——它是混合专家架构,名字听着大,每次实际只调用一小部分参数。

写在最后

限定给足:单次测试,每档只跑一次;轻量档由视觉模型客串,同体积的纯文本模型未测;评分对照上期封存的答案清单逐项判分;两份原始输出全部留档,35B的完整思考过程也在内。

当事人的文书不敢往云端粘的,本地大杯模型已经够格当第一遍校对。签字前的最后一遍,还是你的

本文测试材料均为虚构,仅用于工具测试与律师教学。

关于本号 / 律师实测与核验

胡律用AI

律师视角的法律AI评测实验室

由胡劲科律师主理,围绕法律检索、合同审查、文书校对等实务场景,开展法律AI工具实测,披露测试方法、结果与局限,帮助律师、法务和法律学习者判断工具是否适合自己的工作。

分享可复用的律师提示词模板与法律AI工作流,关注AI幻觉、引用核验和数据脱敏,探索法律MCP、知识库及律所AI应用。AI输出需经律师核验,专业判断与责任始终由律师承担。

胡劲科律师主理人 / 法律实务 AI 课程讲师

Microsoft Certified Professional(MCP,微软认证专业人士)

Gemini Certified Educator(谷歌AI认证教育者)

腾讯 WorkBuddy 效率智能体 OPC 从业者

律所法律实务 AI 课程讲师

广东省律协婚姻家事专委会副秘书长

AI 不是替代专业判断,而是帮我们更快整理资料、生成初稿、搭建思路。
关注「胡律用AI」,一起把 AI 用进真实工作。

话题标签:#法律AI #本地AI #文书校对 #AI评测 #离线工作流 #AI幻觉 #人工核验 #法律AI工作流 #律师提示词模板 #胡律用AI

麻烦各位帮忙点一下右下角「在看」~

原创声明

本文为原创,如其他公众号或其他媒体需要转载,请务必保留原文原意,并注明出自「胡律用AI」、本文作者为「胡劲科」,否则视为侵权,本人将保留追究法律责任的权利。

实测工具,核验结果

关注「胡律用AI」· 法律AI评测、提示词与工作流

原始来源: 胡律用AI

评论 (0)