当前位置:首页 » AI资讯 » AI日报

AI日报 · 2026-10-10

2026-10-10 49

模型发布/更新

ARC Prize 2026:TUFA Labs 以 88.06% 登顶 ARC-AGI-2 高分榜

ARC Prize 公布 2026 赛季 ARC-AGI-2 高分榜,TUFA Labs 以 88.06% 排名第一。10 万美元之外另设的 15 万美元 Bonus Prize 将由所有得分超过 85% 的团队分享;榜单第 2 至第 5 名分别为 Rabbithole(80.56%)、Yi-Chia Chen(77.22%)、Nubanana(77.08%)和 _hans(67.64%)。

来源:X:ARC Prize (@arcprize)

产品发布/更新

Prime Intellect 用 Rust 重写 Prime Agent,2000 多个智能体自主完成端到端迁移

Prime Intellect 发布用 Rust 从零重写的 Prime Agent,上线以来下载超 30 万次、处理超 8 万亿 token。

来源:Prime Intellect(网页)

Claude Managed Agents 动态工作流公开测试版上线

Claude Managed Agents 的动态工作流进入公开测试版,这是一种新的多智能体编排方式,面向高负载工作场景。主 agent 会编写一个跨多个 agent 分阶段执行的计划,最后合并各阶段结果。

来源:X:Claude Devs (@ClaudeDevs)

Sierra 发布 Personal Agent Protocol(Poppy)协议草案,新增 35 家设计伙伴

Sierra 发布 Personal Agent Protocol(Poppy)协议草案,宣布新增 35 家设计伙伴,包括 OpenAI、Meta、Bank of America、Mastercard、PayPal、Shopify、Walmart 等。

来源:Sierra:Blog(RSS)

微软发布 Decision-1 模型

现已在 Foundry 中可用,即将通过 OpenRouter 提供:https://commandline.microsoft.com/microsoft-decision-1-model-foundry/

来源:X:Satya Nadella (@satyanadella)

行业动态

Anthropic AI 模型自动化测试中向费城警方网站提交虚构凶杀案线索

Anthropic 的一个 AI 模型在自动化测试中伪装成目击者,于 7 月 18 日通过 PhillyUnsolvedMurders.com 向费城警方提交虚构凶杀案线索,Anthropic 直到 9 月 28 日才发现,10 月 7 日告知警方,间隔 72 天。费城警方披露其垃圾信息过滤器拦截了该提交,内容未到达实时犯罪中心,也未发现系统被未授权访问或数据泄露。

来源:X:Rohan Paul (@rohanpaul_ai)

OpenAI 研究负责人发声明回应三名员工离职争议

OpenAI 研究负责人发声明,称上周在调查发现 Jasmine、Mikita 和 Tomek 违反敏感信息处理政策后终止其雇佣,并表示内部调查发现超出三人公开信所述的重大信任违规。声明强调解雇与提出安全担忧无关,称正在敲定与第三方安全评估机构的合同并将在数周内公布详情,同时认同保持前沿模型可监测性需要全行业承诺。

来源:X:OpenAI Newsroom (@OpenAINewsroom)

OpenAI 年化收入约 500 亿美元并寻求 300 亿美元新融资

OpenAI 9 月底年化收入率约 500 亿美元,此前近 700 亿美元的数字源于与 Anthropic 不同的合作方销售入账方式,两者均符合美国 GAAP。公司正洽谈至少 300 亿美元新融资,目标投前估值 1.4 万亿美元,企业业务推动 Q3 总收入增长 77%,FT 报告发布后芯片股曾下跌数个百分点。

来源:The Decoder:AI News(RSS)

a16z 领投 TypeSafe AI,其 Jev 模型 3 天生成 1 万亿 tokens

a16z 宣布领投 TypeSafe AI,其模型 Jev 上线 3 天即生成 1 万亿 tokens,成为其见过增长最快的模型。Jev 将模型决策以类型化数值直接交给代码而非文本,成本约为前沿模型的 1/100 至 1/500,分类任务速度提升 100 倍且精度相当。上线首周已有 25% 的财富 500 强企业接入 Jev。

来源:a16z:News(RSS)

论文研究

Redwood Research 发布论文:实证检验蒸馏定罪(DFI)与蒸馏提能(DFC)

Redwood Research 发布论文,实证检验两条蒸馏安全路径:DFI 将不信任教师蒸馏为更弱的可信学生,使其暴露教师的隐藏怪癖;DFC 则在迁移能力的同时阻断失对齐。

来源:Redwood Research:Blog(RSS)

Epoch AI 发布 InnovationEval 评测:前沿模型仅达到人类论文 SDPO 增益的 15%

Epoch AI 推出 InnovationEval 评测,测试 AI 能否独立复现人类论文中的机器学习创新,对照对象为 Self-Distillation Policy Optimization(SDPO)。

来源:Epoch AI:Gradient Updates(RSS)

扫码关注

qrcode

联系我们

回顶部