Contextual Omni Representation
MiniMax 将 H3 的指令理解基础称为 Contextual Omni Representation。语言用于连接目标视频和多个上下文素材,并描述素材之间的关系,使一个请求可以组合镜头运动、角色图片和声音参考等开放式指令。
使用文本、首尾帧及图片、视频、音频参考生成可控 2K 视频。
MiniMax H3 是通用全模态生成模型,能够统一理解文本、图片、视频和音频之间的关系。通过 AI Video API,开发者可以生成 4–15 秒、768p 或原生 2K 视频,使用首尾帧控制、视频动作迁移和音频参考,并通过同一套异步 REST API 与回调流程获取托管结果。
模型能力
MiniMax H3 与你接入的其他视频和图片模型共用同一套 API Key、积分、日志、Webhook 和文档体系。
用自然语言说明提示词、角色图片、动作视频和声音或音乐参考之间的关系。H3 将它们理解为一个完整的创作指令,无需把每种媒体拆分到不同的生成工具。
MiniMax 官方文字说明重点提到 H3 的指令遵循、文字与品牌信息呈现能力,适合需要兼顾构图、文案、产品身份和可读视觉细节的商业内容。
最多添加三个短参考视频,让 H3 复用其中的动作、镜头运动、节奏或表演,同时根据提示词和其他参考素材重新生成主体与视觉风格。
H3 对视频和声音进行联合建模并输出原生双声道。音频参考与至少一个图片或视频参考组合后,可以引导人声、音乐或音效意图,无需单独创建音频任务。
使用一张图片作为首帧,或使用两张图片分别控制首帧和尾帧。首尾帧模式跟随输入图片比例,适合控制场景起点、转场方向和最终构图。
通过统一视频生成端点提交任务并立即获得任务 ID,随后轮询状态或使用回调地址。MiniMax 临时结果会先转存到平台存储,再按统一结构返回。
编写最长 7,000 字符的提示词,选择纯文本、首尾帧或全模态参考模式。图片、MP4/MOV 视频和 MP3/WAV 音频必须使用上游可访问的公网 HTTP(S) URL。
输出时长可设为 4–15 秒,分辨率选择 768p 或 2K。文生视频使用 16:9 等固定比例,首尾帧模式跟随图片,全模态参考模式可使用 adaptive。
向统一视频端点 POST 请求并指定 minimax-h3。平台会校验参考素材、探测计费所需的视频时长、预扣预计积分,并返回用于回调或轮询的任务 ID。
任务成功后,MiniMax 临时结果会在发布完成状态前转存到平台存储。最终 URL 位于 output.urls,可将任务元数据继续用于日志和后续自动化。
curl -X POST https://api.aivideoapi.ai/v1/videos/generations \
-H "Authorization: Bearer sk-your-api-key" \
-H "Content-Type: application/json" \
-d '{
"model": "minimax-h3",
"callback_url": "https://your-server.com/webhook",
"input": {
"prompt": "Use the reference camera motion while keeping the product identity and matching the reference voice",
"generation_type": "omni_reference",
"image_urls": ["https://example.com/product.png"],
"video_urls": ["https://example.com/camera-motion.mp4"],
"audio_urls": ["https://example.com/voice.mp3"],
"resolution": "2k",
"duration": 8,
"aspect_ratio": "adaptive"
}
}'为什么选择 MiniMax H3
MiniMax 将 H3 的指令理解基础称为 Contextual Omni Representation。语言用于连接目标视频和多个上下文素材,并描述素材之间的关系,使一个请求可以组合镜头运动、角色图片和声音参考等开放式指令。
H3-VAE tokenizer 围绕重建质量、易学性和高压缩率重新设计。MiniMax 表示其带来 4 倍有效序列长度收益,降低训练与推理成本,并为原生 2K 生成提供技术基础,而不只是依赖传统后期超分。
H3-Omni Transformer 面向任务泛化和多模态工作负载效率设计。MiniMax 在训练中拆分理解与生成负载并进行联合均衡,官方文字说明称端到端训练吞吐提升接近 30%。
H3 在生成 2K 结果时,会结合原始多模态上下文重新生成自身的低分辨率输出。模型可以再次利用提示词与参考细节完成高分辨率渲染,减少传统独立超分对小文字和细节进行猜测的问题。
常见问题
MiniMax H3 API 是 AI Video API 面向 MiniMax H3 提供的异步 REST 接入。H3 是通用全模态视频模型,接受必填提示词和可选的图片、视频、音频上下文,也支持使用一到两张图片控制首尾帧。请求统一发送到 POST /v1/videos/generations,model 固定为 minimax-h3;接口立即返回任务 ID,并通过轮询或回调提供托管视频结果。
omni_reference 可用于文生视频,或组合任意受支持的图片、视频和音频参考。first_and_last_frames 用于首尾帧生成,此时 image_urls 传入首帧和可选尾帧,不能混用视频或音频。纯文生视频默认 16:9 且不能使用 adaptive;参考模式可以使用 adaptive,首尾帧模式则跟随输入图片尺寸。
全模态参考模式最多支持 9 张图片、3 个视频和 3 个音频 URL。每个参考视频必须为 2–15 秒,所有参考视频合计不超过 15 秒。音频不能作为唯一参考素材,audio_urls 必须同时搭配至少一张图片或一个视频。所有参考必须是公网 HTTP(S) URL,本接口不接受 Data URI 或 MiniMax 私有文件标识。
768p 输出视频和输入参考视频均为每秒 22 积分;2K 均为每秒 34 积分。因此,5 秒 2K 文生视频消耗 170 积分;如果同一请求包含 12 秒参考视频,则按 17 秒乘以 34 积分计费,共 578 积分。前 5 张参考图片免费,第 6 张起每张 9 积分,参考音频免费。
会。MiniMax 官方将 H3 描述为联合生成视频和原生双声道声音,而不是把人声、音效和音乐拆成互不相关的系统。在 omni_reference 模式下,可添加最多三个 MP3 或 WAV 音频参考来引导人声、音乐或音效,但请求必须同时包含至少一个图片或视频参考。当前 AI Video API 计费公式不对参考音频额外收费。
可以。MiniMax 官方文字说明将 V2V Motion Transfer 列为 H3 的重点能力。把公网 MP4 或 MOV 文件放入 video_urls,并在提示词中说明需要复用的动作、镜头运动、节奏或表演。还可以同时加入图片参考以控制主体或视觉身份,加入音频参考以控制声音意图;服务端会先探测所有参考视频时长并校验 15 秒合计上限。
平台会校验输入、按需探测参考视频时长、计算费用并提交异步 MiniMax 任务。任务状态依次为 pending、processing,最后进入 completed 或 failed。可以轮询 GET /v1/tasks/{taskId},也可以提供 callback_url。成功结果会从 MiniMax 临时下载地址转存到平台存储后再写入 output.urls;生成失败会全额退还积分。
建议在提示词中明确每个参考素材的作用,不要只堆叠互不关联的文件。MiniMax 将 H3 定位于广告、品牌、电商、产品设计、UI/UX、游戏、电影片头和动态海报等场景,并重点强调指令遵循、文字和品牌呈现以及可控的多模态编辑。探索方向时可先生成短时长 768p 草稿,再将筛选后的提示词和参考素材用于 2K 最终输出。
定价与用量
按输出时长与探测到的参考视频时长合计计费
默认分辨率;输出与参考视频秒数使用同一单价
第 6 张起每张 9 积分
最多三个音频 URL,需搭配图片或视频参考
一个 API Key、一份积分余额,在视频和图片模型之间无缝切换,无需为每家供应商单独接入。