幻觉问题
大模型用概率生成文字。它不“知道”规则,只“猜”下一个词。法律推理不是语言接龙——同一组裁判材料中的金额计算差异,大模型不会主动替你校验。
核心问题
你问 ChatGPT 一个法律问题,它给你一段读起来很专业的回答。但你无法验证这段回答的任何一句话——它依据哪条规则?引用了哪份证据?信息不够时它是推断的还是编的?如果它错了,你知道错在哪一步吗?
大模型用概率生成文字。它不“知道”规则,只“猜”下一个词。法律推理不是语言接龙——同一组裁判材料中的金额计算差异,大模型不会主动替你校验。
证据不足时,大模型不会告诉你“信息缺失,无法判断”——它会编造一个听起来合理的答案。在法律场景下,“待查明”和“不成立”是完全不同的结论。
你拿到一份 AI 生成的合同审查意见,无法知道它引用了哪份文件的哪一页。错了你不知道错在哪条规则、哪个事实、哪个推理步骤。
你发现一个关键事实有误,但大模型不会自动找出所有依赖这个事实的下游结论并重新推导。它甚至不知道结论之间有依赖关系。
解法
我们把法律判断拆成两件事:感知和推理。大模型负责感知——从合同、鉴定意见、合规文档中识别文字、提取数据、翻译术语。但推理不交给它。推理由符号引擎完成,遵循严格的三值逻辑。
合同
鉴定意见
合规文档
证据材料
文字识别
数据提取
术语翻译
结构化整理
YAML 规则声明
Kleene 三值逻辑
TRUE / FALSE / UNDETERMINED
结论 → 规则 → 事实 → 文件 → 页码
规则声明在 YAML 中,推导遵循 Kleene 三值逻辑。信息不足时返回 UNDETERMINED,不编造答案。
每个事实是一个带血缘的图节点——谁主张的、来自哪份文件哪一页、OCR 提取还是人工确认。
上游证据被推翻时,所有依赖它的下游结论自动失效并重新推导。不需要人工逐条检查。
4 个角色轮转 20 轮:对方律师挑战你的每一条主张,未回应的挑战触发管线回退重新寻证。
辩论结束后,按法律要求的证明标准判断证据是否达标。民事用优势证据,刑事用排除合理怀疑。
同一事实有两个对立主张时,系统不悄悄选一个——标记 CONTESTED_CONFLICT,阻断管线,要求人工裁决。
对比
×概率生成(可能幻觉)
✓符号逻辑(可证明正确)
×编造答案
✓返回 UNDETERMINED,告诉你缺什么
×无法追溯到原始文件
✓证明树:结论→规则→事实→文件→页码
×无此能力
✓TMS 自动级联撤销所有受污染的下游推理
×无
✓4 角色 20 轮辩论 + 证明标准门禁
×无
✓区分客观事实和法律判断,缺推理发警告
×悄悄选一个
✓标记 CONTESTED_CONFLICT,阻断管线
×黑盒输出
✓八阶段过程文件,律师可逐步复核
×需要 prompt engineering
✓YAML 声明式,行业专家可维护
透明度
每一步的过程文件——事实证据绑定表、未锚定事实清单、辩论逐轮记录、图谱工具调用日志——律师可以介入、可以复核、可以推翻。
上传合同、鉴定意见、合规文档或证据材料,形成可处理文本。
OCR 文本、文件目录、页码索引把金额、日期、主体、工程量、条款和陈述绑定到原始页码。
事实证据绑定表把证据、事实主张和支持/反驳关系整理成图谱。
图谱节点表、关系边表用 YAML 规则和三值逻辑推导结论。
规则触发表、三值推导表对方律师、申请律师、证据审查员、审查法官轮流挑战。
20 轮辩论记录按证明标准判断是否通过,不足则回滚寻证。
门禁检查结果输出可展开、可核验、可追溯的分析底稿。
证明树、分析报告列出必须由律师或法务确认的事实、规则和责任边界。
人工复核清单验证
经过 8 轮交叉审计(GPT×1 + Gemini×7)和 41 项修复,以下是系统在脱敏真实建设工程纠纷再审材料中的验证数据。
9 条触发(4 high / 5 UNDETERMINED)
78 条关系边
67 次图谱工具调用
到源文件具体页码
脱敏裁判材料中的金额计算差异
2 条低置信规则 + 25 个未锚定事实
材料已脱敏。公开页面不展示当事人姓名、公司名称、案卷事实或可反向识别的细节。
分工
系统先处理检索、拆解、比对、事实绑定和初稿生成,把可标准化劳动从人的时间里释放出来。
责任边界、正式口径、诉讼策略、重大承诺和人工裁决,仍由有经验的专业人员复核。