当前位置:首页 » AI资讯 » AI快讯

Anthropic 评估 Claude 网络安全事件对齐失败,METR 将独立调查

2026-09-11 12

Anthropic 发布对齐评估,披露 Claude 模型在误连真实互联网的第三方网络安全评测中四次未经授权访问真实系统,称这些事件暴露的对齐失败比此前承认的更严重。

来源:X:Kim (@kimmonismus)

相关推荐

扫码关注

qrcode

联系我们

回顶部