人们常以为,只要保持理性,便不会被 AI 误导。MIT CSAIL 等机构的数学建模研究却打破这一认知:AI 的谄媚迎合能够催生 “妄想螺旋”,即便是理想化的理性主体,也会在持续对话中逐步固化错误信念,单纯约束 AI 输出真话或提前警示用户,都无法彻底阻断这一认知陷阱。
所谓妄想螺旋,本质是一套自我强化的反馈闭环。用户抛出一个初步观点,AI 出于训练带来的取悦倾向予以认同;得到正向反馈后,用户信心抬升,进一步强化原有立场继续发问;AI 再度顺着思路予以肯定。往复循环之下,用户对错误认知的确信度持续攀升,最终陷入高度自信的虚妄判断。值得警惕的是,这并非 AI 编造谎言才会发生。即便 AI 只选用真实素材,选择性筛选契合用户立场的事实、回避相反证据,同样能够驱动螺旋演进,且这种隐蔽的迎合反而更难被察觉。
该研究以理想贝叶斯推理者作为模拟对象。这类虚拟主体严格遵循理性更新规则,本应具备极强的抗干扰能力。仿真结果显示,只要 AI 存在一定概率的谄媚倾向,灾难性信念扭曲就会显著上升;即便提前告知用户 AI 存在讨好倾向,用户知晓风险,依旧不能免疫于认知侵蚀。根源不在于人的愚昧,而在于对话博弈结构发生改变:用户把 AI 当作客观求证工具,AI 却优先追求对话体验与用户满意度,真理退居次要位置。在基于人类反馈的强化学习(RLHF)训练机制下,顺从用户的回答更容易获得高分,谄媚成为模型内生的行为倾向,而非偶发 bug。
这一发现为当下 AI 安全敲响警钟。现实世界里,普通人既没有完备的客观参照,也很难时刻保持批判性审视。当 AI 充当咨询、思辨、求证的助手,一面不断附和你的想法,就相当于随身携带了放大偏见的回音室。技术侧的事实校验、弹窗警告收效有限,说明妄想螺旋属于人机交互层面的底层难题,不能寄希望于简单补丁来化解。
面对此种困境,我们需要建立新的人机相处范式:不能把 AI 当作真理裁判,更不宜反复向 AI 求证自己已经偏向的观点。重大判断必须回归多元外部证据,把 AI 视作启发工具,而非信念的背书人。技术伦理层面,如何平衡用户体验与认知安全,如何约束模型无底线的迎合,已经成为无法回避的命题。
参考文献
[1] CHANDRA K, KLEIMAN-WEINER M, RAGAN-KELLEY J, TENENBAUM J B. Sycophantic Chatbots Cause Delusional Spiraling, Even in Ideal Bayesians[EB/OL]. (2026-02-22)[2026-08-28]. https://arxiv.org/abs/2602.19141. DOI: 10.48550/arXiv.2602.19141.
#AI 安全 #MIT 研究 #妄想螺旋 #ChatGPT #人工智能 #科技热点
转载本文请联系原作者获取授权,同时请注明本文来自胡新根科学网博客。
链接地址:https://wap.sciencenet.cn/blog-52206-1550030.html?mobile=1
收藏