大模型幻觉无法彻底消失时,如何建立事实核验与风险分层
分析模型产生虚假事实的机制,并按业务风险设计检索、约束、拒答和人工复核。
幻觉不是单一错误类型
模型可能编造不存在的事实,也可能把真实信息放到错误主体、时间或条件上。还可能引用正确资料却得出不受证据支持的结论。治理前应按实体错误、数值错误、时间错误、引用错误和推理越界分类,因为不同错误需要不同检测方法。
风险决定防护强度
创意文案允许更大生成空间,政策、财务和医疗问答则需要权威证据与人工审核。为每个场景定义错误后果、可接受不确定性和升级路径。高风险问题不应仅靠更严格的提示词,而要限制数据来源、输出结构和可执行动作。
证据必须参与生成
检索到材料后,要求模型先抽取支持问题的证据,再基于证据回答,并为关键句绑定引用。系统应验证引用片段确实存在、主体与时间一致。找不到足够证据时,应返回信息不足,而不是用常识补齐。数值计算交给确定性工具,并校验单位与精度。
检测器也会犯错
使用另一个模型评审可以发现部分矛盾,但不能视为事实来源。重要结论可与结构化数据库、规则或多个独立来源交叉验证。自动评测需要用人工标注集校准,分别统计漏报和误报,避免检测过严导致大量有价值回答被拒绝。
从失败中持续更新
记录用户纠错、低置信度和高风险命中,将典型案例加入回归集。每次模型或知识库升级后重新评测。可信系统并不承诺永远正确,而是能够识别不确定性、提供证据,并在错误可能造成损失时主动停下。
文章回复
0 条公开回复