Black Forest Labs 发布 FLUX 3:图像、视频与原生音频进入统一模型
Black Forest Labs 推出统一训练图像、视频和音频的多模态基础模型 FLUX 3。视频版已进入申请制 Early Access,可单次生成最长 20 秒原生音频视频;图像版、动作预测版与开放权重版将分阶段推出。
Black Forest Labs(BFL)在 2026 年 7 月 23 日公布 FLUX 3,并开放首批 Early Access。这个新模型把图像、视频和音频放在同一架构中联合训练,视频版可单次生成最长 20 秒、带原生音频的内容,还能把动作预测接入同一模型骨干。
这次发布需要先看清边界:目前开放的是申请制早期访问,完整 API、公开定价和模型权重尚未随公告一起提供。FLUX 3 Image 计划在未来数周进入早期访问,开放权重的 FLUX 3 Dev 则列在后续发布计划中。对创作者和开发者而言,现在适合评估能力方向,还不到直接替换现有生产方案的阶段。
FLUX 3 把声画生成放进同一次推理
FLUX 3 同时学习图像、视频与音频。BFL 给出的核心解释是,同一事件在不同模态中会互相约束:运动要符合物体的质量与接触关系,碰撞画面要对应声音,人物对白要和口型及场景一致。模型由此学习跨越单帧画面、时间变化和声音因果的共同表示。
当前公布的视频能力包括:
- 文本生成视频,并同步生成原生音频;
- 从起始帧续写视频,或把图片作为角色、场景和风格参考;
- 根据参考视频转换场景,同时保留人物等核心元素;
- 续写已有视频与音频;
- 用关键帧控制两个时刻之间的转场;
- 生成多语言对白、动态文字和多种画幅;
- 将多个短片段串联为多镜头序列。
单次生成上限为 20 秒。BFL 的早期评测使用 10 秒、720p、带音频的文生视频样本,FLUX 3 在部分成对比较中获得更高偏好率,例如对 Runway Gen-4.5 为 77%,对 Luma Ray 3.2 为 93%,对 Kling v3 Pro 为 60%。这些数字来自厂商自己的开发期评测,测试工具和模型仍在调整,也没有第三方复现,暂时更适合用来理解产品定位。
从 FLUX 图像模型走向统一的多模态骨干
FLUX.1 与 FLUX.2 的公众认知主要来自图像生成。FLUX 3 把产品范围扩展到视频、音频和动作预测,其技术基础是 BFL 提出的 Self-Flow 方法。官方称,这一方法在同一底层架构中对齐多模态生成与理解,并在更大的算力和数据规模上训练 FLUX 3。
分阶段推出的产品目前可归纳为:
产品 | 主要能力 | 当前状态 |
|---|---|---|
| 视频与原生音频生成、编辑 | Early Access,申请制 |
| 图像生成与编辑 | 计划未来数周开放早期访问 |
| 动作预测与机器人控制 | 面向选定研究及商业伙伴 |
| 面向内容生成和动作预测的开放权重多模态骨干 | 列入后续发布计划 |
BFL 还表示,Video 与 Image 将通过 API 和私有权重访问,FLUX 3 Dev 会提供开放权重。不过,公告没有给出各阶段的精确日期、参数规模、硬件需求、许可证或价格。是否能本地部署、商用成本如何、开放权重能覆盖哪些模态,都要等正式材料。
FLUX-mimic 展示了内容模型之外的用途
FLUX 3 的另一个重点是动作预测。BFL 与瑞士机器人公司 mimic robotics 基于 FLUX 3 骨干开发了 FLUX-mimic:它从视频预测路径的中间特征中提取世界状态,再通过轻量动作解码器输出机器人动作。
双方披露,早期版本已经在 Audi 的生产环境中测试和部署,涉及零件分拣、电子控制单元装配,以及密封件和线缆等柔性材料操作。BFL 的训练实验还显示,在同一骨干中加入动作模态后,视频生成的人类评分一度下降最多 10%,训练约 3500 步后恢复到原有水平。
这部分结果说明 BFL 想把视频模型积累的运动和接触知识用于机器人,但证据仍主要来自参与方。具体任务成功率、跨工厂迁移能力、长期稳定性和部署成本尚缺少独立评估。对普通开发者来说,FLUX-mimic 目前更像技术路线验证,还不是可直接采购的通用机器人 API。
创作者和小团队现在该关注什么
FLUX 3 对内容团队最直接的吸引力,是一次生成同时处理画面、对白、环境声和音效。若声画同步与参考一致性在公开版本中保持稳定,短广告、产品演示、角色短片和社交视频可以减少配音、音效匹配及多工具往返。
不过,早期访问阶段还缺少决定生产价值的几项信息。小团队可以按以下顺序观察:
- 先看可复现的成片质量。 重点测试人物跨镜头一致性、对白清晰度、复杂动作、镜头衔接和文字渲染,避免只比较单个精选样片。
- 再算完整交付成本。 API 单价、失败重试、生成速度、最高分辨率和可用时长会共同决定项目成本。
- 确认权利和部署条件。 商用条款、训练数据政策、私有权重门槛与
FLUX 3 Dev许可证,会影响客户项目和本地部署选择。
FLUX 3 当前最明确的变化,是 BFL 已从静态图像生成扩展到统一的声画模型,并把相同骨干用于动作预测。接下来真正值得跟踪的节点,是 FLUX 3 Image 的开放、Video API 与价格公布、第三方实测,以及开放权重版能否按计划落地。