新模型发布

Black Forest Labs发布FLUX 3:统一多模态模型同时生成视频、音频和机器人动作预测

2026年8月29日,Black Forest Labs发布FLUX 3早期访问版——一个统一的多模态基础模型,同时从图像、视频和音频中学习,可跨模态生成和编辑。FLUX 1和FLUX 2生成图像,FLUX 3则扩展到多模态——可生成20秒带原生音频的视频片段、多语言对话、风格多样的图像,以及为物理AI和机器人提供动作预测基础。

FLUX 3的核心能力包括:文本转视频和图像转视频(支持20秒片段生成,带原生音频、音效和环境音)、多语言语音生成、基于参考图的图像生成(grounded in real world)、高精度文字渲染。在视频生成方面,FLUX 3支持将片段串联为更长多镜头序列并保持角色一致性——这对创作者和电影制作人具有实际价值。但更引人注目的是FLUX 3的机器人动作预测能力——与mimic合作开发的FLUX-mimic视频-动作模型,可以接受视觉观察和文本指令作为输入,预测物理结果并输出机器人控制动作。

FLUX 3的发布代表了一个重要的技术趋势——多模态模型的"统一化"。此前视频生成(如Sora、Veo)、音频生成(如Suno、ElevenLabs)和机器人控制(如RT-2)是三个独立的技术方向,FLUX 3试图将它们统一在一个模型中。这种统一化的优势在于跨模态理解——模型理解了视频中的物理运动规律后,可以将这些理解转移到机器人动作预测中;理解了音频中的语音后,可以生成更自然的对话视频。与mimic的合作也值得关注——mimic在机器人学习和部署方面有专长,结合BFL的基础模型能力,FLUX-mimic可能成为"视频-动作"模型的新范式。对AI工具用户而言,FLUX 3的早期访问意味着创作者即将获得一个"一站式"多模态创作工具——从视频到音频到图像,不再需要在不同工具间切换。而对机器人领域而言,FLUX-mimic的视频-动作预测能力可能加速具身智能的落地——如果模型可以通过观看视频学会预测物理动作,机器人训练的数据效率将大幅提升。

← 返回AI热点列表