当前位置:首页 » AI资讯 » AI快讯

OpenAI 长文阐述对齐与监测困境,称 CoT 监控能力正在减弱

2026-09-07 6

OpenAI 发布长文《An Alien Mind》,回溯 2023 年 RLSlow 项目中确认推理模型可扩展训练的起点,并系统阐述目标对齐与价值对齐的区分。文章指出链式思维监控的效果正随着模型能力提升而逐步减弱,GPT-6 Astra 在对齐上显著优于 GPT-5.6 Sol;作者预期进展可能持续走向机器递归自我改进(RSI),呼吁自愿放缓扩展、建立第三方安全门槛并加强国际协调。

来源:OpenAI:官网动态(RSS · 排除企业/客户案例)

相关推荐

扫码关注

qrcode

联系我们

回顶部