用过一段时间 AI 的人,大概都遇到过这种时刻:它回答得斩钉截铁,时间、地点、数字一应俱全,你差点就信了——直到去查,才发现那个文件根本不存在,那本书根本没有这一页。这不是它在「骗」你,而是它在做一件被训练来做的事:给出一段读起来最顺、最像标准答案的文字。这类现象有个名字,叫幻觉。
幻觉不是撒谎,是它在补最像的答案
语言模型的基本工作是「预测下一个词」。它学到的是文字之间的统计规律,而不是一个可以被查询的事实数据库。当你问一个它没把握的问题时,它不会自动停下来告诉你「我不知道」,而是沿着最可能的语言路径继续往下写——写得越流畅,越像真的。
所以幻觉往往不表现为「胡说八道」,而表现为「看着完全正常,只有细节是编的」。编出来的参考文献格式正确、期刊名眼熟、作者还真有这个人,唯独那篇论文不存在,或者页码对不上。
判断标准不是「它说得像不像真的」,而是「它说的东西,能不能被独立核对」。
这四类问题最容易翻车
第一类是精确事实:具体日期、版本号、价格、条文序号、人物履历。这类信息更新快、颗粒度细,模型很容易把几段相近的记忆拼成一段看似合理的答案。
第二类是引用与出处:论文标题、作者、链接、书名页码。它能生成结构极其规范的引文,但内容可能是虚构的,链接甚至指向一个不存在的页面。
第三类是需要计算或逐条核对的内容:金额汇总、条款比对、名单核对。它更像在「写一个像答案的答案」,而不是真的在算。第四类是模糊提问——你问得太笼统,它只能猜你想问什么,再顺着猜的方向把细节补齐。
四步验证:让答案变得可以核对
第一步,先看措辞。出现「据统计」「研究显示」「根据某某规定」却没有任何具体来源时,把它先标记为待验证,而不是当成结论。
第二步,拆出可核对的最小单元。把回答里的日期、数字、人名、条款号单独拎出来,逐个去权威来源对一遍。能被拆开的,才可能被验证;一整段话是没法验证的。
第三步,反向追问。直接问它:「你刚才这条的依据是什么?如果没有把握,请明确说不确定。」多数情况下,被要求自证时,它会暴露出自己并没有依据。
第四步,让它只在你给的资料里作答。把原文、条款或数据一并贴过去,要求「只根据以上内容回答,找不到就写『材料中未提及』」。这一步能把开放式的猜测,变成有边界的抽取。
常见问题
换个更大的模型能解决吗?
能减轻,不能根除。更强的模型通常更少在常识问题上出错,但幻觉的根源是「按概率续写」,不是参数量不够。越是冷门、越是精确的问题,越需要你自己核对。
它承认「不确定」的时候就可信了吗?
相对更可信,但反过来不成立——它说得肯定,不代表有依据。把「语气确定」和「事实正确」分开看,是避免被带偏的关键。
日常使用怎么降低幻觉?
养成两个习惯:问事实类问题时,要求它给出来源;关键结论一定自己抽查一两条。把 AI 当成帮你把答案写得更快的初稿工具,而不是最终判据。