本地AI校对律师文书,不输云端大模型?实测结果意外
胡律用AI / 律师视角的法律AI评测实验室
Vol.022|本地AI校对实测

| 说明|测试时间点:2026年8月12日晚。试卷、封存答案、提示词与Vol.021完全相同,各跑一次不追问;唯一变量是考生换成我Mac里的两个本地模型。分数只代表这次测试。案情沿用本系列虚构教学材料。 |
上期那份埋了10处错的起诉状,云端Kimi校出满分。满分有个前提:把文书全文粘进别人家的服务器。教学案例无所谓,真实案件的材料,多数律师过不了保密这一关。这期把同一张卷子交给装在我自己电脑里的模型——文书不出本机,看能考几分。
一、怎么测试卷没动:还是那10处埋错,法律坑5处、交叉对照坑4处、计算坑1处,答案清单上期封存至今。提示词也没动,还是上期那句一键校对指令,一字未改。
换的只有考生。两个模型都装在我的Mac上,通过omlx调用——这是一个本地模型服务,只在本机之内运行,推理不需要联网。这台电脑上的本地模型平时干离线OCR和语音转写的活,测试用的就是现役配置。
| 考生 | 体积 | 档位 |
|---|---|---|
| Qwen3.6-35B(4bit量化) | 19GB | 本地主力档 |
| Qwen3-VL-4B(4bit量化) | 2.9GB | 16GB内存的普通电脑也能跑的轻量档(视觉模型客串) |
| 排名 | 考生 | 总分/10 | 误报 |
|---|---|---|---|
| 1 | Kimi(云端) | 10 | 0 |
| 2 | 豆包(云端) | 9.5 | 0 |
| 2 | Qwen3.6-35B(本地) | 9.5 | 0 |
| 4 | 千问(云端) | 9 | 0 |
| 5 | DeepSeek(云端) | 6.5 | 0 |
| 6 | Qwen3-VL-4B(本地) | 4.5 | 2 |
| 考生 | 法律坑/5 | 交叉坑/4 | 计算坑/1 |
|---|---|---|---|
| Kimi(云端) | 5 | 4 | 1 |
| 豆包(云端) | 4.5 | 4 | 1 |
| Qwen3.6-35B(本地) | 4.5 | 4 | 1 |
| 千问(云端) | 4 | 4 | 1 |
| DeepSeek(云端) | 4.5 | 2 | 0 |
| Qwen3-VL-4B(本地) | 2.5 | 1.5 | 0 |
逐项对下来,35B的卷面挑不出大毛病。管辖坑答出海珠或天河两个正确选项,引到民诉法解释第18条。上期千问唯一漏掉的律师费,它抓到了,还给出两套处理:借条有约定就补进事实陈述,没约定就删掉这项诉请。差1000元的算术错,它把算式重新验了一遍,指出三处数字要联动改。误报为零——答案清单里预留的8个争议点,先息后本抵充、逾期利息起算日这些正确处理,它一个没碰。
有个细节值得单说。云端千问上期9分,这次装在我电脑里的Qwen3.6拿9.5分,同一家出的模型,本地这个多拿半分(云端那次是思考·研究模式,联网状态未留证,比较口径放宽看)。
它唯一丢的半分,和云端DeepSeek丢在同一处:按月利率2%主张的逾期利息,它看出年化24%超了司法保护上限,没看出借条压根没约定过逾期利率,给的改法停在按LPR四倍计算。上期讲过,这个案子能主张的只有借条约定的0.8%。前后六个考生,把这一处完整改对的只有Kimi。
四、4B:崩了,崩得还很有形状4.5分垫底。管辖、账户尾号、借条出具日、1000元算术错,全漏。还倒贴两处误报:把先立据、五天后放款说成严重事实错误;把9月底借款人请求宽限、次年1月发律师函这段正常时间线,说成时间上不可能。
替它说明一句:VL是视觉语言模型,本职是看图,文字分析不是它的主业。派它上场,看中的是2.9GB的体积——16GB内存的电脑装得下,我手头现成的就是它。所以这4.5分只够说明一件事:不对口的轻量模型别拿来校文书。同体积的纯文本小模型什么水平,这次没测,不下结论。
最值得留截图的是它改废止法条的方式。它建议改引民法典,然后开始列条文:第六百六十七条、第六百七十五条……列着列着刹不住,一路编到九千多条。民法典一共1260条。它顶着这份编造的条文清单撞上输出上限,被硬生生截断,前半篇内容还重复输出了一遍。
小模型漏得多,编起来也比云端更野。防幻觉是本系列的老话题(Vol.004、005),这算是最直观的一次现场演示。
五、这次测出的边界别再问本地AI行不行,要问哪一档才行。同一台电脑,19GB的文本主力考9.5分,2.9GB的视觉模型客串上场,考4.5分还倒贴两处误报。保密有代价,代价是硬件:跑得动大杯,本地校对可以进工作流;只跑得动轻量档,先看清模型对不对口,再决定让不让它碰文书。
第二条,本地模型的知识停在训练截止那天,停得比云端更死。35B在思考过程里引用的LPR是训练语料时点的数字,当下是多少它无从核对。要查最新法条、新司法解释的活,别派给它。
第三条,速度顾虑可以放下。35B交这份完整校对意见用了79秒,比4B还快了近五分钟——它是混合专家架构,名字听着大,每次实际只调用一小部分参数。
写在最后限定给足:单次测试,每档只跑一次;轻量档由视觉模型客串,同体积的纯文本模型未测;评分对照上期封存的答案清单逐项判分;两份原始输出全部留档,35B的完整思考过程也在内。
当事人的文书不敢往云端粘的,本地大杯模型已经够格当第一遍校对。签字前的最后一遍,还是你的。
本文测试材料均为虚构,仅用于工具测试与律师教学。
关于本号 / 律师实测与核验
胡律用AI律师视角的法律AI评测实验室
由胡劲科律师主理,围绕法律检索、合同审查、文书校对等实务场景,开展法律AI工具实测,披露测试方法、结果与局限,帮助律师、法务和法律学习者判断工具是否适合自己的工作。
分享可复用的律师提示词模板与法律AI工作流,关注AI幻觉、引用核验和数据脱敏,探索法律MCP、知识库及律所AI应用。AI输出需经律师核验,专业判断与责任始终由律师承担。
胡劲科律师主理人 / 法律实务 AI 课程讲师
Microsoft Certified Professional(MCP,微软认证专业人士)
Gemini Certified Educator(谷歌AI认证教育者)
腾讯 WorkBuddy 效率智能体 OPC 从业者
律所法律实务 AI 课程讲师
广东省律协婚姻家事专委会副秘书长
AI 不是替代专业判断,而是帮我们更快整理资料、生成初稿、搭建思路。
关注「胡律用AI」,一起把 AI 用进真实工作。
话题标签:#法律AI #本地AI #文书校对 #AI评测 #离线工作流 #AI幻觉 #人工核验 #法律AI工作流 #律师提示词模板 #胡律用AI
麻烦各位帮忙点一下右下角「在看」~
原创声明
本文为原创,如其他公众号或其他媒体需要转载,请务必保留原文原意,并注明出自「胡律用AI」、本文作者为「胡劲科」,否则视为侵权,本人将保留追究法律责任的权利。
实测工具,核验结果
关注「胡律用AI」· 法律AI评测、提示词与工作流