内容提要
Black Forest Labs发布FLUX 3多模态模型,统一学习图像、视频和音频,基于Self-Flow方法。视频生成最长20秒含原生音频,在偏好测试中优于多数竞品,但训练计算超95%用于视频。访问受限,优先开放视频和动作内容。
延伸解读
多模态统一训练的内在权衡
FLUX 3 将图像、视频和音频统一在一个架构中,但训练资源的分配极不均衡:超过95%的计算用于视频,音频仅占不到0.5%的词元。这种侧重意味着模型在视频生成上的表现可能更优,而音频能力可能相对有限。用户在使用时需注意,尽管模型声称多模态,但各模态的实际性能可能存在显著差异,尤其在音频生成方面可能不如专门的音频模型。
偏好测试的解读与局限
BFL公布的偏好测试显示,FLUX 3在93%的对比中优于Luma Ray 3.2,但对Seedance 2.0和Gemini Omni Flash仅为52%,接近五五开。测试条件为10秒720p带音频的文本转视频,结果仅反映特定场景下的用户偏好,不代表全面性能。此外,偏好测试主观性强,且未涉及图像和音频的独立评估,因此不能简单认为FLUX 3在所有任务上均领先。
访问限制与开源策略
FLUX 3的访问权限受限,优先开放视频和动作内容,图像和公开内容随后。这意味着不同用户或应用场景可能无法立即使用全部功能。同时,Self-Flow的参考实现以Apache-2.0许可开源,但FLUX 3本身并未开源,仅发布了ImageNet研究模型。开发者若想复现或扩展,需依赖开源代码,但无法直接使用FLUX 3的权重,这可能影响其实际应用和二次开发。
Q&A
FLUX 3是什么?
FLUX 3是Black Forest Labs发布的多模态基础模型,能在单一架构内学习图像、视频和音频,也是首个仅用一组权重实现视频、音频和动作预测的FLUX模型。
FLUX 3的底层方法是什么?
FLUX 3基于Self-Flow方法,结合了流匹配目标和自监督特征重构目标,通过自蒸馏从第20层的EMA教师模型到第8层的学生模型进行训练。
FLUX 3视频生成有哪些功能?
FLUX 3视频一次生成可制作长达20秒带原生音频的视频片段,支持文本转视频、图像转视频、从参考片段生成视频、关键帧转视频以及从输入视频和音频生成连续片段。
FLUX 3在偏好测试中表现如何?
在10秒720p带音频的文本转视频测试中,FLUX 3在93%对比中优于Luma Ray 3.2,77%优于Runway Gen-4.5,69%优于Grok Imagine Video,60%优于Kling v3 Pro,59%优于Happy Horse v1,57%优于Happy Horse 1.1,与Seedance 2.0和Gemini Omni Flash持平(52%)。
FLUX 3的训练资源分配情况如何?
视频预测消耗了超过95%的训练计算资源,而音频仅占不到0.5%的词元。
FLUX 3的访问权限如何?
访问权限受限,优先开放视频和动作内容,图像内容随后开放,公开内容最后开放。
FLUX-mimic是什么?
FLUX-mimic是使用与FLUX 3相同骨干网的机器人策略,能在单个RTX 5090上运行,耗时不到80毫秒。