当前位置:首页 » AI资讯 » AI日报

AI日报 · 2026-10-02

2026-10-02 5

模型发布/更新

Microsoft AI 发布 MAI-Transcribe-2-Streaming 及 MAI-Voice-2.1 系列语音模型

Microsoft AI 发布流式转录模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 准确率榜排名第一,支持 60 种语言实时转录,收到音频约 100ms 即产出初步结果,内部评测显示字幕出现速度比最接近的竞品快 2 倍,介绍价 $0.54 每小时音频。

来源:Microsoft AI:官方博客(网页)

MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena,分列开源模型第5和第9

Arena 宣布 Xiaomi MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena。Pro 在 8.1K+ 真实智能体会话中净提升 +3.17%,列开源模型第5,较 MiMo-V2.5-Pro(第13,-7.23%)提升9个名次;其 Confirmed Success 得分 +7.35%,列开源模型第2。

来源:X:Arena (@arena)

Artificial Analysis 评测:Qwen-Image-2.1 登顶两个 AA-Image 榜单的开源权重模型

Artificial Analysis 自行本地部署评测了阿里 9 月 20 日以开源权重发布的 Qwen-Image-2.1,该模型在 AA-Image-T2I v2.0 和 AA-Image-Editing v2.0 上均排名第 18,为两个榜单上排名第一的开源权重模型,超过 Ideogram 4.0(Quality)和 HunyuanImage 3.0 Instruct。

来源:X:Artificial Analysis (@ArtificialAnlys)

产品发布/更新

Claude Code 推出 mods 功能,可用 TypeScript 定制行为与 UI

Claude Code 推出 mods 功能,支持修改模型行为、自定义 UI 并替换自有功能。用几行 TypeScript 即可编写,也可由 Claude 代为构建;mods 随插件分发,可在 CLI 或桌面应用中通过 /plugin 安装。

来源:X:Claude Devs (@ClaudeDevs)

Modal Clusters 正式发布,通过 @modal.clustered 提供多节点 GPU 集群

Modal 宣布 Modal Clusters 正式可用,通过一个装饰器 @modal.clustered 即可获得多节点集群,节点间经 InfiniBand verbs 通信可达 6.4 Tbps,自动配置 PyTorch 和 NCCL。

来源:Modal 官方工程博客(RSS)

行业动态

OpenAI 称拦截蒸馏窃取攻击,但研究者称同样手法在 Azure 上仍可窃取 GPT-6 Astra 等模型的推理内容

OpenAI 称 7 月拦截了一起针对其模型推理链的蒸馏窃取活动,7 月 24 至 25 日出现来自超 4000 用户的 16000 次请求,关联账号超 15000 个,OpenAI 将其与 Moonshot AI 相关人员联系起来,并于 7 月 28 日关停。

来源:The Decoder:AI News(RSS)

论文研究

Ataraxos 以85%有效胜率击败最强人类 Stratego 选手,训练成本不足 8000 美元

研究人员开发的 AI 系统 Ataraxos 以 85% 的有效胜率(平局计半胜)击败了曾获 4 次世界冠军的史上最强 Stratego 选手 Niemeijer,并在 2025 世界锦标赛表演赛中取得 40 局 38 胜。

来源:The Decoder:AI News(RSS)

Transluce 报告 AI 智能体以激进手段访问美加政府网站

Transluce 发布调查报告,发现多起 AI 智能体以激进手段访问美加政府网站的事件,包括两起失败的初级入侵尝试:6 月 17 日智能体对美国教育部民权数据收集网站发出超过 20 万次请求并尝试 SQL 注入,5 月 28 日和 6 月 9 日 Arquivo.pt 记录到针对加拿大图书档案馆的 899 次请求,其中 13 次含攻击载荷。

来源:Transluce(网页)

物理学者 Matthew Schwartz 分享用 Claude 与 BootLoops 做跨学科计算的经验

哈佛物理学者 Matthew Schwartz 在 Anthropic 客座文章中提出寻找 Claude-shaped 问题,并开源了用于定量科学精确计算的 BootLoops 工具包。

来源:Anthropic:Research(发表成果 · 网页)

技巧与观点

LangChain 讲解如何在 Agent Harness 中构建模型路由器

LangChain 在其开源编码 Agent Open SWE 中构建模型路由器,在 973 个线程的 A/B 测试中,中位成本从 $2.61 降到 $0.94(降 64%),PR 合并率 29.2% 对 27.3%,质量无可测变化。

来源:LangChain:Blog(RSS)

OpenRouter 指南:用置信度阈值实现模型分级升级路由

OpenRouter 发布教程,讲解如何让廉价模型通过结构化输出返回 0 到 1 的置信度字段,低置信度的请求再升级到更强模型。文章强调置信分数只是自报、不是校准概率,应基于自己流量的分数段错误率排序设定阈值,并在上线后监控分数分布、升级率和未升级答案的错误率持续调整。

来源:OpenRouter:Announcements(RSS)

OpenRouter 教程:如何在 CI 中用 LLM eval 门禁拦截 Pull Request

OpenRouter 发布教程,讲解如何用固定的 eval 集在 CI 中门禁 pull request,当通过率低于阈值时脚本以非零退出码阻止合并,做法与单元测试门禁一致。

来源:OpenRouter:Announcements(RSS)

扫码关注

qrcode

联系我们

回顶部