
德国人工智能初创公司黑森林实验室正式发布多模态基础模型 Flux3,它能统一理解与生成物理和数字环境,性能超越部分竞品,且多版本将分阶段推出。

Flux3 基于 Self - Flow 架构打造,配备专用编解码器,可实现对物理与数字环境的统一理解与生成。它还是首款支持原生音频生成的模型,能一次性输出长达 20 秒的音视频同步片段。

该模型功能丰富,涵盖文本/图像/视频转视频、基于关键帧的转场及多语言对话等功能,为用户提供了多样化的使用场景。

在 720p 分辨率、10 秒片段的早期测试中,Flux3 性能表现出色,超越 Luma Ray3.2(93%胜率)与 Runway Gen - 4.5(77%胜率),在与顶尖模型对标中也保持微弱优势。

黑森林实验室联合 Mimic Robotics 开发了适用于机器人领域的视频动作模型 Flux - mimic,目前已在奥迪工厂开展生产任务测试,拓展了模型的应用范围。

BFL 采取分阶段推出策略,Flux3Video 现已上线,Flux3Image 与开源权重的"Flux3Dev"也将在近期陆续发布,值得期待。
编辑观点:Flux3 的发布为多模态模型领域注入新活力,其性能优势和丰富功能有望在市场竞争中脱颖而出,后续发展值得关注。

243

被折叠的 条评论
为什么被折叠?



