FLUX 3 开启早期访问:多模态基础模型,多领域能力凸显!

FLUX 3:现实世界模型的重要里程碑

2026 年 7 月 23 日发布的这篇文章显示,FLUX 3 已开启早期访问。它是全新的多模态基础模型,能在统一架构内同时从图像、视频和音频中学习,学习的是整个世界的表征,比如物体组合、事物运动以及事件声音等。

单一模态无法完整描述世界,每种模态都是对同一底层现实的投影,且都会丢失一些信息。图像捕捉特定时间点的空间结构,视频恢复时间维度,音频揭示机械现象和声学因果关系,语言则将感知与目标、抽象概念和指令联系起来。从单一模态学习能得到该投影的良好模型,而同时从所有模态学习,它们之间的相互约束能提供更多信息,让各种模态成为反映同一底层现实的证据。FLUX 3 是首个基于这一原则构建的模型,是开发现实世界视觉智能使命中的重要里程碑,早期成果表明这是正确的道路。

FLUX 3:一个模型,多种能力

FLUX 3 基于 [Self - Flow](https://bfl.ai/research/self - flow) 方法构建,该方法能在同一底层架构中高效地对齐多模态生成和理解。基于此方法,大幅扩展了计算和数据资源,以同时对视频、图像和音频进行训练。这里还给出了 Self - Flow 与 Flow Matching (FM) 的对比,左图是每种模态的生成误差(Fréchet 距离),均以 FM = 100 进行归一化(数值越低越好);右图是通过微调在四个任务组上的操作任务成功率(数值越高越好)。

能力与早期评估

视频

FLUX 3 能在一次生成中创建长达 20 秒、带有音频的高度多样化视频。其核心能力众多,包括文本到视频生成、图像到视频生成(可从起始帧继续生成或把图像作为视觉参考)、从参考剪辑进行视频到视频生成、根据输入的视频和音频进行生成式视频 - 音频延续、关键帧到视频生成、多语言对话、广泛的视觉风格和纵横比、将单个剪辑智能链接成更长的多镜头序列、高度的风格多样性以及强大的排版生成和动画设计能力(所有输出均自带原生音频生成)。

在初步分析中,生成了 720p、10 秒带音频的文本到视频剪辑。由于模型及其配套工具仍在开发中,这些结果只是初步的,预计在早期访问阶段会有进一步改进。在早期评估中,与 Grok Imagine Video 相比,FLUX 3 在多达 69% 的对比中更受青睐;与 Kling v3 Pro 相比,为 60%;与 Happy Horse v1 相比,为 59%;与 Happy Horse 1.1 相比,为 57%;与 Seedance 2.0 和 Gemini Omni Flash 相比,为 52%;与 Runway Gen - 4.5 相比,在 77% 的对比中更受青睐;与 Luma Ray 3.2 相比,在 93% 的对比中更受青睐。尽管仍在开发中,FLUX 3 Video 在捕捉人类面部表情、将声音与物理事件关联以及多语言能力方面已经表现出色,还能结合这些能力创建持续数分钟的序列,通过视觉参考确保角色在所有场景中保持一致。目前,FLUX 3 Video 已开启 [早期访问](https://bfl.ai/models/flux - 3)。

图像

FLUX 3 能以各种风格、纵横比和分辨率合成和编辑图像。在训练中期的初步评估中,相比早期版本已有显著改进,处理复杂提示和文本生成的能力大幅提升,能生成多种输出风格,并能以多种语言呈现高精度文本。和视频评估一样,这些只是初步结果,预计在发布前会有进一步改进。未来几周,将为 FLUX 3 Image 开启早期访问阶段。

行动

FLUX 3 对世界的理解还延伸到行动预测,采取了两条途径:一是将原生行动预测直接集成到 FLUX 3 中,扩展在 Self - Flow 方面的初步工作;二是将预训练的视频骨干网络作为具有动态感知能力的基础,让专业的行动模型可以利用有限的特定任务数据进行微调。mimic robotics 是首批获得 FLUX 3 早期访问权限的合作伙伴之一,共同开发了 FLUX - mimic,这是一个结合了 FLUX 3 骨干网络和 mimic 在机器人灵巧操作学习及生产部署方面专业知识的视频 - 行动模型。

发布计划

在接下来的几周和几个月里,将逐步推出以下功能,每个功能都会先进行早期访问阶段,以确保顺利推出、收集反馈并进行严格的安全测试。所有功能均基于同一底层多模态流匹配模型构建,包括:通过 API 和私有权重访问进行视频和音频生成与编辑(“FLUX 3 Video”);通过选定的研究和商业合作伙伴进行行动预测,从 mimic robotics 开始(“FLUX - mimic 和 FLUX 3 Action”);通过 API 和私有权重访问进行图像合成与编辑(“FLUX 3 Image”);开放多模态骨干网络的权重访问,用于内容创作(视频、音频和图像)和行动预测(“FLUX 3 Dev”)。还将发布关于底层方法的更多技术细节。

未来展望

才刚刚开始探索多功能、强大且统一的多模态模型及其所能实现的应用,从交互式图像和视频编辑、模拟到计算机应用和物理 AI,未来发展空间广阔。在逐步推出新功能的同时,已经在着手研发下一代模型,目标是在同一统一模型中实现感知、行动和语言预测的统一。如果有兴趣探索和使用 FLUX 3,可以联系相关人员;如果想为使命做出贡献,欢迎加入,正在 [德国和美国招聘](https://bfl.ai/careers)。

内容概要:本报告基于寻汇与万事达卡在2026年联合发布的《超越自动化:定义智能体驱动的全球支付》白皮书,系统分析了AI智能体在B2B跨境支付领域的应用与发展。报告指出,传统跨境支付存在效率低、人工干预、合规风险高等问题,当前正从数字化、数据化迈向“自主化”新阶段。AI智能体可在授权下自主完成支付、换汇、合规审核、对账等全流程操作,核心技术包括深度强化学习、自然语言处理和图神经网络,用于路径优化、合规解析与异常检测。报告揭示了决策可解释性不足、跨系统协同标准缺失、安全审计机制缺位三大研究空白,并探讨了法律责任归属、监管碎片化、数据主权与技术可靠性四大现实挑战。寻汇与万事达卡的合作构建了“智能体编排引擎”与全球合规决策网络,首次提出L0-L5的智能体自主化等级框架,推动行业标准化。预计2026至2027年将实现首批大规模商业部署,提升支付效率超30%。; 适合人群:金融科技研究人员、AI技术开发者、跨境支付行业从业者、企业财资管理人员及政策监管机构相关人员。; 使用场景及目标:①理解AI智能体在跨境支付中的技术架构与应用场景;②把握自主化支付的演进趋势与商业化前景;③为金融机构和技术公司布局AI驱动型支付系统提供战略参考;④助力监管机构制定适应智能体时代的合规框架。; 阅读建议:本报告兼具技术深度与产业视野,建议结合白皮书原文及相关技术文献对照研读,重点关注智能体决策逻辑、合规实现机制与跨系统集成方案,并关注后续试点项目的实际成效与监管反馈。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值