MiniMax H3

11小时前更新 11 0 0

全模态视频生成模型。

收录时间:
2026-08-08

最近的视频生成模型,画质越来越高,但真正用起来,经常还是要在多个功能之间来回切换:文生视频用一个模型,动作参考用另一个,想加配音和音效,又得单独处理。

MiniMax H3 想解决的,正是这个问题。

MiniMax H3是MiniMax在2026年7月31日正式发布的新一代通用全模态生成模型。它能同时理解文本、图片、视频、声音,然后生成带原生立体声音轨的视频内容

H3大模型在2026年8月3日正式开源了,最高支持15秒、2K分辨率(2560×1440)、24帧每秒的输出。目前在Artificial Analysis视频编辑评测榜和Arena视频编辑排行榜上都拿了全球第一。这成绩确实挺能打的。

官方介绍原文:https://www.minimaxi.com/blog/minimax-h3

核心功能

H3的核心能力我总结下来就三条:

第一,全模态输入理解。 你可以把文本、图片、视频、音频混在一起丢进去,让它理解你的意图。最多支持混合输入12个文件,提示词上限高达7000字符。举个例子,你可以给一段参考视频、一张人物图片、一段音频,然后告诉它“用视频1的镜头运动方式,让图2里的人物唱音频3里的歌”——H3自己会完成复杂的全模态理解。这个功能在实际创作中真的挺实用,不用像以前那样分开搞好几个步骤。

第二,多模态精准编辑与控制。 包括文生视频、图生视频、首尾帧控制、主体参考、动作参考等等。特别是V2V Motion Transfer(视频到视频动作迁移),可以把一段视频里的人物动作迁移到另一段视频里,同时保持主体形象和画面风格。我试了下“华强买瓜”的梗视频,动作迁移的效果还挺丝滑的。

第三,商用级内容生成。 官方说它“具备商用级的多场景内容生成能力”,在指令遵循、文字与品牌信息呈现方面表现不错。实际测试中,文字渲染确实清晰锐利,不像有些模型生成的字像糊了一层马赛克。

产品特点

H3的特点,我觉得最值得说的有这几个:

1. 打破模态边界,走“通用”路线。 MiniMax之前做过Hailuo 01和02两代模型,到H3这代他们意识到一个问题——以前的模型太“分裂”了:图片生成分T2I、编辑、主体参考、动作参考……全是独立的专家模型;声音生成也是人声、音效、音乐分开研究。H3的做法是把这些都统一起来,让模型在预训练阶段就具备广泛的多模态理解和生成能力。这个思路挺像DeepSeek在语言模型领域做的事——走通用路线而不是搞一堆专用模型。

2. 性价比极其能打。 H3默认提供2K分辨率输出,2K下每秒价格0.8元,768P下每秒0.5元。什么概念呢?业内同类旗舰模型的三分之一左右。有个博主烧了4000块钱对比测试,H3生成15秒视频账单才7块钱,而某竞品2.5版本同样的时长要35块。这价格差距确实让人有点上头。

3. 开源+国产芯片兼容。 H3设计初期就考虑了多款国产芯片的兼容性,官方也计划开放模型权重。这对国内开发者来说是个好消息,不用非得绑在特定硬件上。

使用教程

我梳理了三条路径,看你是什么需求:

路径一:网页端直接体验(最适合小白) 

去MiniMax官网、Hailuo AI或者PixPix的网页端,界面逻辑很简单:选文生视频或图生视频,输入提示词,选分辨率、时长、比例,点生成就行。整个过程像填一个创意表单,零门槛。在PixPix上就能直接用,门槛很低。

路径二:API调用(适合开发者) 

platform.minimaxi.com注册账号,在“账户管理→接口密钥”生成API Key,然后按文档调用就行。适合想集成到自己工作流里的朋友。

路径三:本地部署(适合折腾党) 

H3开源后可以本地部署。官方模型权重大概115GB,对硬件有要求。GitHub上已经有社区维护的部署指南和ComfyUI工作流。如果你显卡不够猛,建议还是走前两条路。

数据统计

相关导航

暂无评论

none
暂无评论...