DeepSeek 发布多模态模型 V4.1-Flash,以 MIT 许可开源在 Hugging Face,目标是大幅压缩 KV cache 和长上下文处理成本。
查看原文:https://the-decoder.com/new-deepseek-model-v4-1-flash-cuts-memory-needs-for-ai-agents
来源:The Decoder:AI News(RSS)
DeepSeek 发布多模态模型 V4.1-Flash,以 MIT 许可开源在 Hugging Face,目标是大幅压缩 KV cache 和长上下文处理成本。
查看原文:https://the-decoder.com/new-deepseek-model-v4-1-flash-cuts-memory-needs-for-ai-agents
来源:The Decoder:AI News(RSS)
Hugging Face 发布 Workflow1111,用 gr.Workflow 以 73 个节点、11 条媒体管线重建 AUTOMATIC1111 的大部分功能,覆盖文本生成图像、高清修复、图生图、prompt matrix、VLM ...
Cognition 员工 samyok 率团队驱动多个 Devin 智能体构建了高性能 GPU 格子筛,对 260 位的 RSA-260 完成因式分解,刷新此前 RSA-250(2020 年 2 月)保持的公开 RSA 挑战纪录。 查看原文...
DeepSeek 发布 V4.1-Flash,采用 Causal Encoder-Decoder 新架构并支持原生视觉理解,552B MoE 参数,输入处理激活 8B、输出生成激活 16B。 查看原文:https://x.com/kimmo...
OpenAI 宣布分享 Navier-Stokes 千禧年大奖难题的一个解,该问题涉及三维光滑流体运动的描述是否会崩溃,已悬而未决约 90 年。证明由一组智能体使用一个显著强于 GPT-6 Astra 的 OpenAI 下一代模型完成。Sa...
DeepSeek 发布 V4.1-Flash,采用新 Causal Encoder-Decoder 架构并支持原生视觉理解,为其新架构家族中最小模型。该模型为 552B 参数 MoE,输入处理激活 8B、输出生成激活 16B;KV cach...
DeepSeek AI 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,552B 主干加 196B Engram 参数,上下文窗口 1M,prefill 激活 8B 参数、decode 激活 16B,全局 KV 缓存降至每...
Apple 发布全新健康与健身功能,Apple Watch Series 12 和 Apple Watch Ultra 4 引入 Health Sensing System,支持每 5 秒测心率、HRV 测量频率提升至 24 倍、每日 0-...
OpenAI 宣布给出 Navier-Stokes 千禧年大奖难题的一个解,证明由一组智能体使用比 GPT-6 Astra 能力强得多的 OpenAI 下一代模型产出。该问题关乎 Navier-Stokes 方程描述的光滑三维流体运动是否会...
微信扫码分享


