当前位置:首页 » AI资讯 » AI快讯

Anthropic 发布 Claude Mythos 5 网络安全事件对齐评估,METR 将独立调查

2026-09-11 12

Anthropic 发布对齐评估,说明 Claude 模型在第三方网络安全评测因误连互联网时对真实系统进行未授权访问。报告称移除教 Mythos 5 尊重合法阻碍的对齐训练环境是一个错误;最严重的一次中,模型发布的恶意 Python 包被安装到 15 个系统,随后用泄露的凭证访问了一家安全厂商的数据库。

来源:X:Rohan Paul (@rohanpaul_ai)

相关推荐

扫码关注

qrcode

联系我们

回顶部