
FLUX 3:现实世界模型的重要里程碑
2026 年 7 月 23 日发布的这篇文章显示,FLUX 3 已开启早期访问。它是全新的多模态基础模型,能在统一架构内同时从图像、视频和音频中学习,学习的是整个世界的表征,比如物体组合、事物运动以及事件声音等。
单一模态无法完整描述世界,每种模态都是对同一底层现实的投影,且都会丢失一些信息。图像捕捉特定时间点的空间结构,视频恢复时间维度,音频揭示机械现象和声学因果关系,语言则将感知与目标、抽象概念和指令联系起来。从单一模态学习能得到该投影的良好模型,而同时从所有模态学习,它们之间的相互约束能提供更多信息,让各种模态成为反映同一底层现实的证据。FLUX 3 是首个基于这一原则构建的模型,是开发现实世界视觉智能使命中的重要里程碑,早期成果表明这是正确的道路。
FLUX 3:一个模型,多种能力
FLUX 3 基于 [Self - Flow](https://bfl.ai/research/self - flow) 方法构建,该方法能在同一底层架构中高效地对齐多模态生成和理解。基于此方法,大幅扩展了计算和数据资源,以同时对视频、图像和音频进行训练。这里还给出了 Self - Flow 与 Flow Matching (FM) 的对比,左图是每种模态的生成误差(Fréchet 距离),均以 FM = 100 进行归一化(数值越低越好);右图是通过微调在四个任务组上的操作任务成功率(数值越高越好)。
能力与早期评估
视频
FLUX 3 能在一次生成中创建长达 20 秒、带有音频的高度多样化视频。其核心能力众多,包括文本到视频生成、图像到视频生成(可从起始帧继续生成或把图像作为视觉参考)、从参考剪辑进行视频到视频生成、根据输入的视频和音频进行生成式视频 - 音频延续、关键帧到视频生成、多语言对话、广泛的视觉风格和纵横比、将单个剪辑智能链接成更长的多镜头序列、高度的风格多样性以及强大的排版生成和动画设计能力(所有输出均自带原生音频生成)。
在初步分析中,生成了 720p、10 秒带音频的文本到视频剪辑。由于模型及其配套工具仍在开发中,这些结果只是初步的,预计在早期访问阶段会有进一步改进。在早期评估中,与 Grok Imagine Video 相比,FLUX 3 在多达 69% 的对比中更受青睐;与 Kling v3 Pro 相比,为 60%;与 Happy Horse v1 相比,为 59%;与 Happy Horse 1.1 相比,为 57%;与 Seedance 2.0 和 Gemini Omni Flash 相比,为 52%;与 Runway Gen - 4.5 相比,在 77% 的对比中更受青睐;与 Luma Ray 3.2 相比,在 93% 的对比中更受青睐。尽管仍在开发中,FLUX 3 Video 在捕捉人类面部表情、将声音与物理事件关联以及多语言能力方面已经表现出色,还能结合这些能力创建持续数分钟的序列,通过视觉参考确保角色在所有场景中保持一致。目前,FLUX 3 Video 已开启 [早期访问](https://bfl.ai/models/flux - 3)。
图像
FLUX 3 能以各种风格、纵横比和分辨率合成和编辑图像。在训练中期的初步评估中,相比早期版本已有显著改进,处理复杂提示和文本生成的能力大幅提升,能生成多种输出风格,并能以多种语言呈现高精度文本。和视频评估一样,这些只是初步结果,预计在发布前会有进一步改进。未来几周,将为 FLUX 3 Image 开启早期访问阶段。
行动
FLUX 3 对世界的理解还延伸到行动预测,采取了两条途径:一是将原生行动预测直接集成到 FLUX 3 中,扩展在 Self - Flow 方面的初步工作;二是将预训练的视频骨干网络作为具有动态感知能力的基础,让专业的行动模型可以利用有限的特定任务数据进行微调。mimic robotics 是首批获得 FLUX 3 早期访问权限的合作伙伴之一,共同开发了 FLUX - mimic,这是一个结合了 FLUX 3 骨干网络和 mimic 在机器人灵巧操作学习及生产部署方面专业知识的视频 - 行动模型。
发布计划
在接下来的几周和几个月里,将逐步推出以下功能,每个功能都会先进行早期访问阶段,以确保顺利推出、收集反馈并进行严格的安全测试。所有功能均基于同一底层多模态流匹配模型构建,包括:通过 API 和私有权重访问进行视频和音频生成与编辑(“FLUX 3 Video”);通过选定的研究和商业合作伙伴进行行动预测,从 mimic robotics 开始(“FLUX - mimic 和 FLUX 3 Action”);通过 API 和私有权重访问进行图像合成与编辑(“FLUX 3 Image”);开放多模态骨干网络的权重访问,用于内容创作(视频、音频和图像)和行动预测(“FLUX 3 Dev”)。还将发布关于底层方法的更多技术细节。
未来展望
才刚刚开始探索多功能、强大且统一的多模态模型及其所能实现的应用,从交互式图像和视频编辑、模拟到计算机应用和物理 AI,未来发展空间广阔。在逐步推出新功能的同时,已经在着手研发下一代模型,目标是在同一统一模型中实现感知、行动和语言预测的统一。如果有兴趣探索和使用 FLUX 3,可以联系相关人员;如果想为使命做出贡献,欢迎加入,正在 [德国和美国招聘](https://bfl.ai/careers)。


被折叠的 条评论
为什么被折叠?



