首页 / 教程 / 疑难排查

模型幻觉是什么:四步验证 AI 说得对不对

用过一段时间 AI 的人,大概都遇到过这种时刻:它回答得斩钉截铁,时间、地点、数字一应俱全,你差点就信了——直到去查,才发现那个文件根本不存在,那本书根本没有这一页。这不是它在「骗」你,而是它在做一件被训练来做的事:给出一段读起来最顺、最像标准答案的文字。这类现象有个名字,叫幻觉。

幻觉不是撒谎,是它在补最像的答案

语言模型的基本工作是「预测下一个词」。它学到的是文字之间的统计规律,而不是一个可以被查询的事实数据库。当你问一个它没把握的问题时,它不会自动停下来告诉你「我不知道」,而是沿着最可能的语言路径继续往下写——写得越流畅,越像真的。

所以幻觉往往不表现为「胡说八道」,而表现为「看着完全正常,只有细节是编的」。编出来的参考文献格式正确、期刊名眼熟、作者还真有这个人,唯独那篇论文不存在,或者页码对不上。

判断标准不是「它说得像不像真的」,而是「它说的东西,能不能被独立核对」。

这四类问题最容易翻车

第一类是精确事实:具体日期、版本号、价格、条文序号、人物履历。这类信息更新快、颗粒度细,模型很容易把几段相近的记忆拼成一段看似合理的答案。

第二类是引用与出处:论文标题、作者、链接、书名页码。它能生成结构极其规范的引文,但内容可能是虚构的,链接甚至指向一个不存在的页面。

第三类是需要计算或逐条核对的内容:金额汇总、条款比对、名单核对。它更像在「写一个像答案的答案」,而不是真的在算。第四类是模糊提问——你问得太笼统,它只能猜你想问什么,再顺着猜的方向把细节补齐。

四步验证:让答案变得可以核对

第一步,先看措辞。出现「据统计」「研究显示」「根据某某规定」却没有任何具体来源时,把它先标记为待验证,而不是当成结论。

第二步,拆出可核对的最小单元。把回答里的日期、数字、人名、条款号单独拎出来,逐个去权威来源对一遍。能被拆开的,才可能被验证;一整段话是没法验证的。

第三步,反向追问。直接问它:「你刚才这条的依据是什么?如果没有把握,请明确说不确定。」多数情况下,被要求自证时,它会暴露出自己并没有依据。

第四步,让它只在你给的资料里作答。把原文、条款或数据一并贴过去,要求「只根据以上内容回答,找不到就写『材料中未提及』」。这一步能把开放式的猜测,变成有边界的抽取。

常见问题

换个更大的模型能解决吗?

能减轻,不能根除。更强的模型通常更少在常识问题上出错,但幻觉的根源是「按概率续写」,不是参数量不够。越是冷门、越是精确的问题,越需要你自己核对。

它承认「不确定」的时候就可信了吗?

相对更可信,但反过来不成立——它说得肯定,不代表有依据。把「语气确定」和「事实正确」分开看,是避免被带偏的关键。

日常使用怎么降低幻觉?

养成两个习惯:问事实类问题时,要求它给出来源;关键结论一定自己抽查一两条。把 AI 当成帮你把答案写得更快的初稿工具,而不是最终判据。

把校验也做进工作流

需要处理大量事实性内容时,可以把「抽取—核对—改写」拆成几次独立调用,每一步都限定输入范围,出错时也更容易定位是哪一环。用站内接口搭这类小流程很直接,按量计费,先跑通再放大。

留言交流

有问题、有补充,写两句吧~留言会实时显示在下方(无需注册)。

留言加载中…
← 上一篇:AI 客户端问题排查合集:连不上、报错、没反应