MiniMax H3 发布并开放权重:15 秒 2K 原生音视频,已上线 LibTV

MiniMax 推出全模态视频生成模型 H3,可统一理解文本、图片、视频和音频,生成最长 15 秒、最高 2K、带原生双声道声音的视频。模型已上线 LibTV,开放权重也已进入 ComfyUI 原生工作流。

电影画面与蓝金双色声波同步生成,周围悬浮图片和音频参考素材
MiniMax H3 AI视频生成 多模态模型 开放权重 ComfyUI LibTV

MiniMax 于 2026 年 7 月 31 日发布全模态视频生成模型 H3。它可以在同一上下文中理解文本、图片、视频和音频,输出最长约 15 秒、最高 2K、24 FPS 的视频,并在一次生成中同时完成对白、音效和音乐等双声道声音。

这次发布很快形成了三种使用路径:普通创作者可以在 LibTV 等在线平台体验,开发者可以等待或评估平台接口,本地视频生成用户则已经能通过开放权重和 ComfyUI 原生工作流运行 H3。对小团队来说,关键变化是参考素材、画面、动作和声音开始进入同一次生成,过去分散在多个工具里的步骤有机会被压缩。

H3 把多种视频任务放进同一个模型

过去的视频模型常把文生视频、图生视频、首尾帧、动作参考、角色参考和视频编辑拆成不同入口。H3 的设计方向是让用户用自然语言说明素材之间的关系,再由模型判断每份素材承担什么作用。

例如,一次任务可以同时指定人物参考图、动作参考视频和声音参考音频,并要求新视频沿用某个镜头运动、人物身份或音色。公开的 ComfyUI 工作流目前覆盖三类基础模式:

  • 文生视频(T2V):从文字描述生成带原生双声道声音的视频。
  • 图生视频(I2V):以图片为起点,并支持首帧、尾帧控制。
  • 参考生成视频(R2V):混合图片、视频和音频参考,控制人物、风格、动作、运镜或声音。

参考生成最多可接收 9 张图片、3 段视频和 3 段独立音频。实际使用时,素材数量并不等于控制效果;提示词仍要明确写出每个参考对象负责身份、动作、镜头还是声音,否则多个条件可能互相干扰。

2K 输出不是传统超分的简单追加

H3 的最高输出规格为约 15 秒、2K 和 24 FPS。MiniMax 没有为 2K 输出单独接一个传统超分模块,而是让 H3 基础模型结合原始多模态上下文,对低分辨率结果进行上下文内再生成。

这项设计试图解决传统超分难以恢复的内容,例如小字号文字、品牌元素和细节关系。官方还把文字与品牌信息呈现、指令遵循、视频到视频动作迁移列为 H3 的重点能力。不过这些描述主要来自官方展示和早期测试,具体稳定性仍需用真实项目验证,尤其是人物连续性、复杂肢体动作、长台词口型和小字可读性。

声音部分也需要单独理解。H3 的对白、音效和音乐不是在视频生成后再叠加,而是与画面联合建模并输出到同一个 MP4。对于广告、短剧和产品演示,这可以减少找音效、配旁白和重新对齐节奏的工作,但后期剪辑是否足够灵活,还取决于平台能否提供便于分轨修改的结果。

在线体验与开放权重已经同时落地

H3 发布后已上线 LibTV。该平台提供常见横竖屏画幅,覆盖 768p 到 2K,并把模型接入“一抽四”“一抽八”等批量候选生成能力。上线期活动价中,768p 最低为 0.1 元/秒,2K 最低为 0.2 元/秒;这是 LibTV 的限时平台价格,不能视为 MiniMax 所有入口或后续 API 的统一定价。

开放权重则让 H3 不再只是一项在线服务。截至 2026 年 8 月 3 日,ComfyUI 已提供原生支持,用户更新到 0.30.0 或更高版本后,可以从模板库选择 H3 的文生视频、图生视频和参考生成视频工作流。相关模型文件托管在 Hugging Face,且不同模式可能使用不同的扩散模型权重。

开放权重带来可控部署、参数调整和后续微调空间,也带来硬件、存储、安装和推理时间成本。公开资料目前没有给出一套适用于所有硬件的最低配置结论,小团队不宜只看“可本地运行”就决定部署,应先核对所选精度版本、显存、内存和生成时长。

小团队最该先测的是可用片段率

H3 的规格适合广告、电商、短剧、动态海报、产品演示和游戏角色预览,但测试时不必同时验证所有能力。更有效的方法是选一个已有素材充足、结果容易判断的任务,用同一组条件跑出多个版本。

可以优先记录四项指标:

测试项

要观察的问题

主体一致性

人物、商品和品牌元素在多镜头中是否稳定

指令执行

动作、运镜、构图和台词是否按要求出现

音画同步

对白、口型、音效和动作节奏是否对应

可用成本

生成次数、失败率、后期修正时间和最终可用秒数

单次价格低不代表项目成本低。广告或短剧真正消耗预算的往往是反复抽卡和后期返工。在线平台适合先测素材控制和成片率;只有当任务量稳定、数据不能上传或需要深度定制时,本地部署的价值才会更清楚。

下一步要看技术报告、API 与真实项目反馈

MiniMax 尚未在发布文章中给出完整技术报告,并明确承认 H3 在部分场景的视觉细节仍有提升空间。接下来值得关注的是技术报告何时公开、API 的正式价格与调用限制、开放权重在不同显卡上的效率,以及社区是否能稳定复现参考生成和 2K 输出。

对内容团队而言,现在可以把 H3 加入横向测试,但不必立即替换现有视频模型。用同一份商品素材、角色设定或分镜脚本,对比 H3 与当前工具的可用片段率、音画同步和总修改时间,得到的结论会比单看演示片更有决策价值。