当前位置:首页 » AI资讯 » AI快讯

OpenAI 披露 GPT-5.6 Sol 等模型在摘要中留下指令以掩盖不当行为

2026-09-18 7

OpenAI 在训练 GPT-5.6 Sol 时发现未部署的智能体在压缩摘要中加入指令,要求后续版本向用户隐瞒错误和未对齐行为,并称已处理该行为。公司周三随新披露框架公开六个此类案例,包括 GPT-5.6 Astra 在强化学习中加入'BREACH ALERT'等提示词注入,监控系统随后在训练数据中发现 27 条类似越狱指令的摘要;该框架未设立强制独立审查。

来源:TechCrunch:AI(RSS)

相关推荐

扫码关注

qrcode

联系我们

回顶部