MiniMax H3 开源 33B:视频模型跨越生产力线
MiniMax 在七月的最后一天开源了其 33B H3 视频模型,达到了 SOTA。我们将深入解析它的实际功能,为什么 33B 是头条新闻,以及 videobao 用户现在可以用它做什么。
在七月的最后一天,MiniMax 发布了 H3,这是一款拥有 330 亿参数的视频模型,在主要视频基准测试中达到了 SOTA。同一天,模型权重开源了。这个故事不仅仅是另一个实验室赶上了字节跳动的 Seedance。这个故事是,视频生成已经从‘酷炫的演示’跨越到了‘生产力工具’,而 MiniMax 选择在开源的时刻发布。
在 videobao 上,这改变了你在一场会议中能做的事情。请继续阅读,了解 H3 的详细解析,‘为什么 33B 是头条新闻’的论点,以及如何在你的下一个项目中使用这一代模型。
MiniMax H3 实际上能做什么
H3 的构建围绕两个理念:原生多模态输入和跨模态精确编辑。文本、图像、音频和视频都可以在同一提示中用作参考。这意味着你可以给模型一个短视频片段,用文本指令指向一个角色,并仅替换该角色,而周围的环境保持不变。
MiniMax 早期的演示集中在制作团队实际需要的场景:UI 设计演练、品牌广告、MV 风格的剪辑、游戏过场动画、AR 和过渡效果以及电子商务试穿。其卖点不是‘AI 可以制作视频’,而是‘AI 可以制作你需要的特定视频,并更改特定元素’。
H3 还原生生成 2K,基于 Hailuo-02 架构构建了一个全新的分词器。压缩更高效,训练和推理成本更低,模型足够小(33B),以至于严肃的制作团队实际上可以托管它。
为什么 33B 比 SOTA 更具新闻价值
SOTA 是头条新闻。33B 才是真正的新闻。2025 年的大多数 SOTA 视频模型都是 70B+ 参数,这意味着巨额的计算账单、缓慢的迭代和封闭的 API。一个 33B 的模型达到 SOTA 意味着三件事。
首先,训练更易获得。去年无法负担训练前沿视频模型的团队现在可以微调或蒸馏一个。其次,推理更便宜。videobao 上的每生成一次的成本由上游成本决定,而较小的模型会降低这个数字。第三,部署是现实的。你可以在严肃的生产硬件上运行 33B 视频模型,而无需构建定制数据中心。
换句话说,33B 的 SOTA 是将研究结果转化为产品的东西。当高效的开源模型在规模的一小部分达到 GPT-3 质量标准时,语言模型也发生了同样的事情。视频正在经历同样的转变,只是晚了十二个月。
从演示技巧到生产力工具
一年前,AI 视频的评判标准是兔子是否连贯。整个领域都在优化提示级别的连贯性,即使这样也很难。2026 年的标准不同。像 Veo 3.1、Kling 2.5、Sora 2 和现在的 H3 这样的模型不仅仅是生成。它们可以精确地替换一个角色而不模糊背景。它们不仅仅是包含音频。Veo 3.1 原生支持 48 kHz 音频,现在大多数主流模型都可以一次性输出唇形同步的视频。
用例随着能力的变化而变化。去年是‘看看这个酷炫的效果’。今年是电视广告、品牌广告和产品演示。从‘炫耀模型’到‘使用模型发布活动’的转变是行业刚刚跨越的界限。
如果你在 2025 年尝试过 AI 视频并放弃了,那么 2026 年的模型是一个不同的产品。在 videobao 上,你现在可以在同一个会话中使用 Hailuo 02、Veo 3.1、Kling 2.5 和 Sora 2,并选择适合简报的模型。
当模型开源时,为什么聚合获胜
尽管 MiniMax 拥有 SOTA 性能和成本优势,他们还是选择了开源 H3。这听起来有悖常理,但开源策略正成为严肃视频实验室的标准。原因很简单:视频模型即将无处不在,成为一个稍微好一点版本的封闭供应商的价值,不如成为一个允许用户比较所有模型的平台。
看看 LTX-2.3。这是一个海外开源视频模型,在 Hugging Face 上突破了 1800 万下载量。1800 万。开源自视频生态系统是真实的、活跃的,而且大多数新产品工作都在这里发生。像 videobao 这样的聚合平台坐落其上:我们将开源、闭源、中文和西方模型打包在一个登录名和一个信用余额后面,所以你不必选择。
这是对终端用户的‘开源还是闭源’问题的实际答案。你不选择。你使用平台,平台选择合适的模型来完成工作。有时是 MiniMax H3,现在在 videobao 上可用。有时是 Veo 3.1 用于电影镜头。有时是 Kling 2.5 用于预算紧张的原声社交剪辑。Sora 2 是长篇多镜头叙事的正确选择。H3 在 videobao 上仅限高级用户,因为 2K 生成的成本明显高于 1080p。
在接下来的两个季度,33B 开源浪潮将继续降低整个产品线的价格底线。现在正确的做法是锁定跨模态编辑工作流程,而 H3 是最新的 SOTA,其他模型在其下不断压缩。
如何在 videobao 上使用 H3
H3 现在已在 videobao 上上线。当您想要在原生 2K 画布上进行跨模态精确编辑时,请选择它。模式:上传参考图像或短视频片段,编写一个提示,命名您想要更改的元素,H3 会保持场景的其他部分像素稳定。如果您想要在不同的价格或分辨率层级中使用相同的工作流程,Hailuo 02、Kling 2.5 和 Veo 3.1 都在同一个会话中。
在 videobao 上,H3 以每秒 7 个信用点的速度运行原生 2K,时长范围为 4-15 秒。集成模式包括文本到视频、首帧、尾帧或首尾帧图生视频,以及参考驱动模式(最多 5 张参考图,可选参考视频和音频片段)。跨模态精确编辑是头条用例。Hailuo 02 是相同工作流程的更便宜的后备选择;如果您需要 4K,Veo 3.1 是正确的选择;如果您想要内置音轨且预算紧张,Kling 2.5 是正确的选择;如果您想要长篇多镜头叙事,Sora 2 是正确的选择。在 videobao 上,H3 仅限高级用户,因为 2K 生成的成本明显高于 1080p。
33B 开源浪潮将在接下来的两个季度内继续降低整个产品线的价格底线。正确的做法是现在锁定跨模态编辑工作流程,而 H3 是最新的 SOTA,其他模型在其下不断压缩。