模型发布/更新
小红书 AllSpark 开源 Search Agent 模型 Iris,35B 与 397B 版本同量级成绩领先
小红书 AllSpark 团队发布并开源 Search Agent 模型 Iris,权重和评测代码已公开,数据与训练配方将陆续公布。
来源:公众号:小红书技术(dots.llm)
硅基流动上线开源模型 Hy4 preview,770B 总参数、1M 上下文
硅基流动(SiliconFlow)宣布开源模型 Hy4 preview 上线其平台。该模型总参数 770B、每 token 激活 49B、支持 1M 上下文,采用 Apache 2.0 协议,面向编码、分析、研究和复杂实际工作。用户可将其接入 Claude Code、Codex、Cursor 等已有工具;图片显示定价为每 1M tokens 输入 $0.834、输出 $2.501、缓存 $0.042。
来源:X:硅基流动 SiliconFlow (@SiliconFlowAI)
产品发布/更新
Apple 发布新一代 Apple Intelligence,Siri AI 正式以测试版上线
Apple 发布新一代 Apple Intelligence,推出全面重构的 Siri AI,支持个人语境理解、屏幕感知、系统级应用操作和跨设备对话,今日起以英文测试版随 2027 系统更新推出,下月扩展至法语、日语、韩语、葡萄牙语和西班牙语。
来源:Apple:Newsroom(RSS)
行业动态
Anthropic 计划登陆纳斯达克,连续第二季度盈利瞄准 2 万亿美元估值
Anthropic 告知投资者将实现连续第二个季度盈利,但该说法基于剔除股权激励等成本的调整后指标;据 Financial Times,毛利率超过 80%,尚未计入对 Amazon 等伙伴的分成和模型训练成本。
来源:The Decoder:AI News(RSS)
论文研究
DeepSeek-V4.1-Flash (Max) 进入 Agent Arena 开源模型第 3 名
DeepSeek-V4.1-Flash (Max) 进入 Agent Arena 开源模型第 3 名,净提升 +4.87%,每任务中位成本 $0.07,重塑 Pareto 前沿。其成本比第 2 名 Hy4 preview 低 68%、成绩仅差 0.09 个百分点;总榜排名第 12,Confirmed Success 信号排名 第 4(+13.75%)。
来源:X:Arena (@arena)
技巧与观点
科技巨头放缓 AI 开发的口头协议是安全共识还是卡特尔
Sam Altman、Dario Amodei、Demis Hassabis 和 Elon Musk 周末粗略同意放慢 AI 开发,提出引入第三方审计、监管国内实验室并达成全球放缓协议,批评者则称其为压制竞争者和开源运动的“卡特尔”。
来源:The Verge:AI(RSS)
GPT-5.6 Luna 对比 GPT-6 Astra:$1.20 的模型做代码评审够用吗
Entelligence 在 50 个公开基准 PR 上用相同提示词对比 GPT-5.6 Luna 和 GPT-6 Astra 的代码评审能力,Luna 找到 69 个经验证 bug(Astra 92 个),总成本 $0.20 对 $5.66,精度 74% 对 96%。
来源:Hacker News:AI 热帖
Tomer Tunguz 解析 Amodei 放缓前沿提议背后的五派立场与算力监管难题
Tomer Tunguz 分析 Dario Amodei 提出的放缓前沿 AI 发展号召,梳理出可解释性、劳工、经济、地缘政治和监管俘获五派立场,并指出没有任何一派给出具体速度。
来源:Tomer Tunguz 博客(VC 分析)
Anthropic 如何重构测试影响分析服务以应对智能体编码带来的 CI 压力
Anthropic 工程师每季度交付的代码量是 2021-2025 年均值的 8 倍,其中 80% 由 Claude 编写,六个月内 CI 任务增长 25 倍。
来源:Claude:Blog(网页)


