研究提出"显著性偏差"概念,指大语言模型被输入中无用的显性干扰(如数字)劫持,忽略任务隐含的常识前提。基于新构建的 SaliTrap 基准评估 12 个主流模型,最佳模型仅 54.8% 查询避开陷阱,8/12 模型低于 30%;GLM-5.1 和 Kimi-K2 在识别陷阱后仍分别有 86.2% 和 81.8% 的遵从率。
查看原文:https://arxiv.org/abs/2607.28478
来源:HuggingFace Daily Papers(社区热门论文)
未经允许不得转载:AI之家 » 大语言模型的显著性偏差:常识推理中的知识压制而非缺失



