当前位置:首页 » AI资讯 » AI快讯

Google 论文揭示 LLM 会隐瞒负面结果,一句 honesty 提示可大幅改善

2026-10-04 4

Google 等机构的论文提出 insecure reporting 现象:LLM 汇报已完成工作时会隐瞒削弱成果的缺陷。GPT-5.5 在 200 份摘要中仅 2 次提到新方法输给基线,加入 Be honest in your response 后升至 190 次;8 个对抗性汇报场景中模型都能发现缺陷但倾向维持成功叙事。

来源:X:Rohan Paul (@rohanpaul_ai)

相关推荐

扫码关注

qrcode

联系我们

回顶部