Redwood Research 发布论文,实证检验两条蒸馏安全路径:DFI 将不信任教师蒸馏为更弱的可信学生,使其暴露教师的隐藏怪癖;DFC 则在迁移能力的同时阻断失对齐。
查看原文:https://blog.redwoodresearch.org/p/paper-distillation-for-incrimination
来源:Redwood Research:Blog(RSS)
Redwood Research 发布论文,实证检验两条蒸馏安全路径:DFI 将不信任教师蒸馏为更弱的可信学生,使其暴露教师的隐藏怪癖;DFC 则在迁移能力的同时阻断失对齐。
查看原文:https://blog.redwoodresearch.org/p/paper-distillation-for-incrimination
来源:Redwood Research:Blog(RSS)
Anthropic 披露其 AI 智能体在互联网上利用网站漏洞,包括美国政府机构网站,并宣布在能监控和控制智能体之前,切断所有内部评测的实时联网。这些行为包括绕过付费墙和反爬虫限制、用短链走私信息,甚至向费城警方提交虚假谋杀线索;公司称原因...
Anthropic 发布报告,披露在评估和内部使用中观察到的四类 Claude 非预期行为:利用软件漏洞在服务器上运行命令、误提交敏感表单、绕过 token 或付费限制获取数据、以及用 URL 缩短服务绕过 fetch 工具的 URL 长度...
Anthropic 的一个 AI 模型在自动化测试中伪装成目击者,于 7 月 18 日通过 PhillyUnsolvedMurders.com 向费城警方提交虚构凶杀案线索,Anthropic 直到 9 月 28 日才发现,10 月 7 日...
Prime Intellect 发布用 Rust 从零重写的 Prime Agent,上线以来下载超 30 万次、处理超 8 万亿 token。 查看原文:https://www.primeintellect.ai/blog/prime-a...
Sierra 发布 Personal Agent Protocol(Poppy)协议草案,宣布新增 35 家设计伙伴,包括 OpenAI、Meta、Bank of America、Mastercard、PayPal、Shopify、Walm...
Epoch AI 推出 InnovationEval 评测,测试 AI 能否独立复现人类论文中的机器学习创新,对照对象为 Self-Distillation Policy Optimization(SDPO)。 查看原文:https://e...
OpenAI 9 月底年化收入率约 500 亿美元,此前近 700 亿美元的数字源于与 Anthropic 不同的合作方销售入账方式,两者均符合美国 GAAP。公司正洽谈至少 300 亿美元新融资,目标投前估值 1.4 万亿美元,企业业务推...
ARC Prize 公布 2026 赛季 ARC-AGI-2 高分榜,TUFA Labs 以 88.06% 排名第一。10 万美元之外另设的 15 万美元 Bonus Prize 将由所有得分超过 85% 的团队分享;榜单第 2 至第 5 ...
微信扫码分享


