All models

MiniMax-H3 ★

MiniMaxVideo
0.6007–0.9611 Credits
Get your API key
MiniMax-H3

融合图文音视频参考的原生有声短片模型

MiniMax-H3 是面向短片创作的通用多模态音视频模型,能够结合文本、图片、视频和音频理解创作意图,生成带原生立体声的视频。它既适合从脚本开始构建镜头,也适合用首尾帧控制转场,或用多种参考素材引导人物、产品、动作与声音,适用于广告、角色叙事和音画节奏内容。

MiniMax模型品牌
视频模型类型
视频任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

成片时长
4–15秒,整数时长
输出分辨率
768P、2K
画幅控制
21:9、16:9、4:3、1:1、3:4、9:16及adaptive
原生音画规格
24 FPS视频;32 kHz立体声音频
创作方式
文生视频、首帧/尾帧/首尾帧、多模态参考生成
参考数量
图片最多9张、视频最多3段、音频最多3段;合计最多12个文件
文本与交付
文本项最长7000字符;支持等待结果、异步查询及回调

帧率与音频采样率为原生模型规格,本平台入口提供分辨率、时长、画幅与素材角色控制。

核心能力

了解 MiniMax-H3 能为你的工作带来什么。

画面与声音共同创作

H3联合生成视频与立体声,不必把画面构思和声音设计完全分开。提示词可以同时描述主体动作、镜头变化、环境声、对白与音乐氛围,让声音服务于场景表达,而不是仅在成片后附加一条背景音。

首尾帧约束镜头走向

提供首帧可让已有商品图、海报或角色画面动起来;提供尾帧可指定镜头最终落点;同时提供两者则用于生成中间变化。创作重点是说明过渡动作,并尽量保持两张图片的构图、比例和光线协调。

让不同素材各司其职

参考图片用于引导人物、服装、产品或风格,参考视频用于引导动作与运镜,参考音频用于引导音色、音乐或节奏。把每份素材的职责写清楚,更适合组织复杂创作,也方便判断成片是否保留了关键特征。

适用场景

从具体任务出发,找到模型发挥作用的位置。

商品与品牌短片

输入商品图、模特图和场景参考,描述产品特写、人物使用动作与结尾展示方式,生成横屏或竖屏广告素材。人物外观与商品结构应分别指定,交付前重点检查轮廓、佩戴关系、反射和品牌文字。

角色叙事与分镜预演

输入角色和空间参考,配合人物关系、情绪变化、景别与对白描述,制作短剧片段或分镜预演。可用近景表现眼神与表情,用参考图引导服装和外观,再将合适的短片段纳入后续剪辑流程。

动作与音乐节奏内容

将动作视频、人物图片与音频作为参考,说明谁执行动作、采用什么镜头以及声音如何配合画面,生成舞蹈或时尚节奏短片。素材应先裁成与目标片段相关的短段,避免无关内容干扰创作重点。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

H3与H3 Max如何取舍

需要2K输出、4秒起步的短镜头,或希望围绕多模态素材进行完整音画创作时,可选择H3。H3 Max是另一个经过速度优化的型号,原生输出为480P或768P、时长5–15秒;更重视快速生成时可考虑它,但不要把两者的规格混用。

按控制目标选择创作方式

没有现成素材时,用文本明确主体、动作、镜头与声音;已有确定的开头或结尾画面时,选择首尾帧模式;需要结合人物外观、动作和音色时,选择参考模式。首尾帧与参考素材不能放在同一请求中,应先确定最重要的控制目标。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • 单次生成限于4–15秒,分辨率选择768P或2K。更长叙事需要拆分镜头再剪辑,跨片段的人物、空间与声音连续性应逐段检查,不宜把单次短片生成当作长视频制作。
  • 参考视频与音频每段须为2–15秒,各类总时长不超过15秒,混合参考合计最多12个文件。参考素材并非越多越好,应明确保留内容,并避免互相矛盾的动作、造型或声音要求。
  • 素材参考与首尾帧控制用于引导生成,不等于逐像素复刻。商品细节、文字、复杂动作与对白衔接仍需检查;涉及人物肖像、音色和品牌资产时,应使用具有合法授权的素材。

常见问题

解答使用 MiniMax-H3 时的常见疑问。

MiniMax-H3可以只用文字生成视频吗?

可以。content中提供非空text项即可开始文生视频,同时设置resolution、duration和固定ratio。提示词建议依次说明主体、动作、场景、镜头、光线与声音;纯文本模式不能使用adaptive画幅。

首帧图片与参考图片有什么区别?

first_frame用于指定视频开始画面,reference_image用于引导主体外观、产品或风格,不要求它成为开头。需要控制最终画面可用last_frame;首尾帧模式不能与reference_*素材混合使用。

可以用音频引导声音和节奏吗?

可以在参考模式中使用reference_audio,并在文本里说明它用于音色、对白、音乐还是节奏。音频素材支持WAV和MP3;H3原生支持立体声生成,中文和英文均属于稳定支持的对白语言。

2K输出只是普通放大吗?

H3的原生2K流程使用再生成方式,将基础视频与原始上下文共同用于恢复细节,而不是仅采用传统超分辨率模块。调用时选择resolution为2K即可表达输出需求,不需要自行组织这些内部生成步骤。

如何提交任务并取得成片?

向/minimax/videos提交MiniMax-H3及content素材,默认等待完成返回task。传async=true或callback_url可立即取得任务标识,再通过/minimax/tasks查询或接收回调;成功后从task.content.url获取成片。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 MiniMax-H3 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。