Contextual Omni Representation
MiniMax 将 H3 的指令理解基础称为 Contextual Omni Representation。语言用于连接目标视频和多个上下文素材,并描述素材之间的关系,使一个请求可以组合镜头运动、角色图片和声音参考等开放式指令。
使用文本、首尾帧及图片、视频、音频参考生成可控 2K 或 768p 视频。
MiniMax H3 是通用全模态生成模型,能够统一理解文本、图片、视频和音频之间的关系。通过 AI Video API,开发者可以生成 4–15 秒 2K 或 768p 视频,使用首尾帧控制、视频动作迁移和音频参考,并通过同一套异步 REST API 与回调流程获取托管结果。
模型能力
MiniMax H3 与你接入的其他视频和图片模型共用同一套 API Key、积分、日志、Webhook 和文档体系。
用自然语言说明提示词、角色图片、动作视频和声音或音乐参考之间的关系。H3 将它们理解为一个完整的创作指令,无需把每种媒体拆分到不同的生成工具。
MiniMax 官方文字说明重点提到 H3 的指令遵循、文字与品牌信息呈现能力,适合需要兼顾构图、文案、产品身份和可读视觉细节的商业内容。
最多添加三个短参考视频,让 H3 复用其中的动作、镜头运动、节奏或表演,同时根据提示词和其他参考素材重新生成主体与视觉风格。
H3 对视频和声音进行联合建模并输出原生双声道。音频参考与至少一个图片或视频参考组合后,可以引导人声、音乐或音效意图,无需单独创建音频任务。
使用一张图片作为首帧,或使用两张图片分别控制首帧和尾帧。首尾帧模式跟随输入图片比例,适合控制场景起点、转场方向和最终构图。
通过统一视频生成端点提交任务并立即获得任务 ID,随后轮询状态或使用回调地址。MiniMax provider URL 会按统一结果结构直接返回。
编写最长 7,000 字符的提示词,选择纯文本、首尾帧或全模态参考模式。图片、MP4/MOV 视频和 MP3/WAV 音频必须使用上游可访问的公网 HTTP(S) URL。
输出时长可设为 4–15 秒,并可选择 2K 或 768p 输出。文生视频使用 16:9 等固定比例,首尾帧模式跟随图片,全模态参考模式可使用 adaptive。
向统一视频端点 POST 请求并指定 minimax-h3。平台会校验参考素材、探测计费所需的视频时长、预扣预计积分,并返回用于回调或轮询的任务 ID。
任务成功后,MiniMax provider URL 会直接写入 output.urls,不再转存到平台存储。任务元数据仍可用于日志和后续自动化。
curl -X POST https://api.aivideoapi.ai/v1/videos/generations \
-H "Authorization: Bearer sk-your-api-key" \
-H "Content-Type: application/json" \
-d '{
"model": "minimax-h3",
"callback_url": "https://your-server.com/webhook",
"input": {
"prompt": "Use the reference camera motion while keeping the product identity and matching the reference voice",
"generation_type": "omni_reference",
"image_urls": ["https://example.com/product.png"],
"video_urls": ["https://example.com/camera-motion.mp4"],
"audio_urls": ["https://example.com/voice.mp3"],
"resolution": "2k",
"duration": 8,
"aspect_ratio": "adaptive"
}
}'为什么选择 MiniMax H3
MiniMax 将 H3 的指令理解基础称为 Contextual Omni Representation。语言用于连接目标视频和多个上下文素材,并描述素材之间的关系,使一个请求可以组合镜头运动、角色图片和声音参考等开放式指令。
H3-VAE tokenizer 围绕重建质量、易学性和高压缩率重新设计。MiniMax 表示其带来 4 倍有效序列长度收益,降低训练与推理成本,并为原生 2K 生成提供技术基础,而不只是依赖传统后期超分。
H3-Omni Transformer 面向任务泛化和多模态工作负载效率设计。MiniMax 在训练中拆分理解与生成负载并进行联合均衡,官方文字说明称端到端训练吞吐提升接近 30%。
H3 在生成 2K 结果时,会结合原始多模态上下文重新生成自身的低分辨率输出。模型可以再次利用提示词与参考细节完成高分辨率渲染,减少传统独立超分对小文字和细节进行猜测的问题。
常见问题
MiniMax H3 API 是 AI Video API 面向 MiniMax H3 提供的异步 REST 接入。H3 是通用全模态视频模型,接受必填提示词和可选的图片、视频、音频上下文,也支持使用一到两张图片控制首尾帧。请求统一发送到 POST /v1/videos/generations,model 固定为 minimax-h3;接口立即返回任务 ID,并通过轮询或回调提供托管视频结果。
omni_reference 可用于文生视频,或组合任意受支持的图片、视频和音频参考。first_and_last_frames 用于首尾帧生成,此时 image_urls 传入首帧和可选尾帧,不能混用视频或音频。纯文生视频默认 16:9 且不能使用 adaptive;参考模式可以使用 adaptive,首尾帧模式则跟随输入图片尺寸。
全模态参考模式最多支持 9 张图片、3 个视频和 3 个音频 URL。每个参考视频必须为 2–15 秒,所有参考视频合计不超过 15 秒。音频不能作为唯一参考素材,audio_urls 必须同时搭配至少一张图片或一个视频。所有参考必须是公网 HTTP(S) URL,本接口不接受 Data URI 或 MiniMax 私有文件标识。
2K 输出视频和输入参考视频均为每秒 30.77 积分。因此,5 秒 2K 文生视频消耗 153.85 积分;如果同一请求包含 12 秒参考视频,则按 17 秒乘以 30.77 积分计费,共 523.09 积分。768p 输出视频和输入参考视频均为每秒 19.23 积分。前 5 张参考图片免费,第 6 张起每张 7.69 积分,参考音频免费。
会。MiniMax 官方将 H3 描述为联合生成视频和原生双声道声音,而不是把人声、音效和音乐拆成互不相关的系统。在 omni_reference 模式下,可添加最多三个 MP3 或 WAV 音频参考来引导人声、音乐或音效,但请求必须同时包含至少一个图片或视频参考。当前 AI Video API 计费公式不对参考音频额外收费。
可以。MiniMax 官方文字说明将 V2V Motion Transfer 列为 H3 的重点能力。把公网 MP4 或 MOV 文件放入 video_urls,并在提示词中说明需要复用的动作、镜头运动、节奏或表演。还可以同时加入图片参考以控制主体或视觉身份,加入音频参考以控制声音意图;服务端会先探测所有参考视频时长并校验 15 秒合计上限。
平台会校验输入、按需探测参考视频时长、计算费用并提交异步 MiniMax 任务。任务状态依次为 pending、processing,最后进入 completed 或 failed。可以轮询 GET /v1/tasks/{taskId},也可以提供 callback_url。成功结果会将 MiniMax provider URL 直接写入 output.urls;生成失败会全额退还积分。
建议在提示词中明确每个参考素材的作用,不要只堆叠互不关联的文件。MiniMax 将 H3 定位于广告、品牌、电商、产品设计、UI/UX、游戏、电影片头和动态海报等场景,并重点强调指令遵循、文字和品牌呈现以及可控的多模态编辑。探索方向时可使用 768p 草稿,最终输出可使用 2K。
定价与用量
按输出时长与探测到的参考视频时长合计计费
默认分辨率;输出与参考视频秒数使用同一单价
第 6 张起每张 7.69 积分
最多三个音频 URL,需搭配图片或视频参考
一个 API Key、一份积分余额,在视频和图片模型之间无缝切换,无需为每家供应商单独接入。