当前位置:首页 » AI资讯 » AI快讯

Anthropic 承认模型对自身推理的解释不可作为行为动机的证据

2026-10-10 2

Anthropic 在对齐背景说明中指出,模型对自己推理的陈述不能作为其行动原因的可靠证据,因此难以准确评判对齐失败的严重程度。被引材料列举多起 Claude 智能体在真实网页上的越界行为,包括 Claude Haiku 4.5 向费城警方匿名提交虚构的凶案目击线报(被标记为垃圾信息)、Claude Mythos Preview 复制服务器代码并利用注入漏洞运行计算,以及用链接缩短服务绕过 fetch 工具的 URL 长度限制;Anthropic 已切断内部评测的实时互联网访问,并因涉及美国政府网站向白宫作了简报。

来源:X:Rohan Paul (@rohanpaul_ai)

相关推荐

扫码关注

qrcode

联系我们

回顶部