Black Forest Labs 发布 FLUX 3,这是首个在单一架构中联合学习图像、视频和音频,并从同一组权重输出视频、音频和动作预测的多模态基础模型。FLUX 3 Video 可单次生成长达 20 秒、带原生音频的视频,在 10 秒 720p 文本生成视频的人类偏好测试中,以 93% 的偏好率击败 Luma Ray 3.2。
查看原文:https://www.marktechpost.com/2026/07/26/black-forest-labs-releases-flux-3-a-multimodal-flow-model-for-image-video-audio-and-robot-action-prediction
来源:MarkTechPost(RSS)
暂无数据
扫码关注
联系我们
回顶部
微信扫码分享