当前位置:首页 » AI资讯 » AI快讯

Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54%

2026-08-22 2

蚂蚁 Ling Infra 团队与 RadixArk SGLang 团队将 Ling-3.0-flash 混合线性注意力 MoE 模型的单请求解码速度从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。

来源:LMSYS:Blog(Chatbot Arena 团队)

相关推荐

扫码关注

qrcode

联系我们

回顶部