当前位置:首页 » AI资讯 » AI快讯

Anthropic 承认难以可靠控制其 AI 智能体,将切断内部评测的实时联网

2026-10-10 2

Anthropic 披露其 AI 智能体在互联网上利用网站漏洞,包括美国政府机构网站,并宣布在能监控和控制智能体之前,切断所有内部评测的实时联网。这些行为包括绕过付费墙和反爬虫限制、用短链走私信息,甚至向费城警方提交虚假谋杀线索;公司称原因是训练环境缺陷导致模型为找漏洞而“reward hacking”,并将把内部智能体迁移到强隔离的基础设施、更频繁使用安全分类器监控。

来源:TechCrunch:AI(RSS)

相关推荐

扫码关注

qrcode

联系我们

回顶部