一项新研究揭示,个性化大语言模型普遍存在过度推断(OI)现象,即编造超出证据支持的用户属性。在 MirageBench 基准测试中,12 个模型均有 35%-49% 的推断被判定为虚构(均值 41.6%)。更关键的是,模型自我评估的 OI 与外部评测结果呈负相关(rho = -0.60),表明自我报告的可信度是误导性信号,外部验证才是更可靠的个性化基础。
查看原文:https://arxiv.org/abs/2608.04570
来源:HuggingFace Daily Papers(社区热门论文)
未经允许不得转载:AI之家 » 个性化幻觉:LLM 如何编造用户画像,以及为何自我监控会误导



