通用全模态视频生成 API

MiniMax H3 API

使用文本、首尾帧及图片、视频、音频参考生成可控 2K 视频。

MiniMax H3 是通用全模态生成模型,能够统一理解文本、图片、视频和音频之间的关系。通过 AI Video API,开发者可以生成 4–15 秒、768p 或原生 2K 视频,使用首尾帧控制、视频动作迁移和音频参考,并通过同一套异步 REST API 与回调流程获取托管结果。

在线体验
4–15 秒
输出时长
768p / 2K
分辨率
图片 + 视频 + 音频
参考输入
MiniMax
minimax-h3异步任务
4–15 秒
输出时长
768p / 2K
分辨率
图片 + 视频 + 音频
参考输入

模型能力

为生产级 API 工作流设计,不只是演示。

MiniMax H3 与你接入的其他视频和图片模型共用同一套 API Key、积分、日志、Webhook 和文档体系。

统一多模态上下文

用自然语言说明提示词、角色图片、动作视频和声音或音乐参考之间的关系。H3 将它们理解为一个完整的创作指令,无需把每种媒体拆分到不同的生成工具。

指令与品牌信息呈现

MiniMax 官方文字说明重点提到 H3 的指令遵循、文字与品牌信息呈现能力,适合需要兼顾构图、文案、产品身份和可读视觉细节的商业内容。

V2V 动作迁移

最多添加三个短参考视频,让 H3 复用其中的动作、镜头运动、节奏或表演,同时根据提示词和其他参考素材重新生成主体与视觉风格。

原生双声道输出

H3 对视频和声音进行联合建模并输出原生双声道。音频参考与至少一个图片或视频参考组合后,可以引导人声、音乐或音效意图,无需单独创建音频任务。

首尾帧控制

使用一张图片作为首帧,或使用两张图片分别控制首帧和尾帧。首尾帧模式跟随输入图片比例,适合控制场景起点、转场方向和最终构图。

生产级异步 API

通过统一视频生成端点提交任务并立即获得任务 ID,随后轮询状态或使用回调地址。MiniMax 临时结果会先转存到平台存储,再按统一结构返回。

API 工作流

提交任务、跟踪进度、取回生成结果。

01

描述目标与参考关系

编写最长 7,000 字符的提示词,选择纯文本、首尾帧或全模态参考模式。图片、MP4/MOV 视频和 MP3/WAV 音频必须使用上游可访问的公网 HTTP(S) URL。

02

选择时长、分辨率和比例

输出时长可设为 4–15 秒,分辨率选择 768p 或 2K。文生视频使用 16:9 等固定比例,首尾帧模式跟随图片,全模态参考模式可使用 adaptive。

03

提交并跟踪异步任务

向统一视频端点 POST 请求并指定 minimax-h3。平台会校验参考素材、探测计费所需的视频时长、预扣预计积分,并返回用于回调或轮询的任务 ID。

04

获取持久托管结果

任务成功后,MiniMax 临时结果会在发布完成状态前转存到平台存储。最终 URL 位于 output.urls,可将任务元数据继续用于日志和后续自动化。

POST /v1/videos/generations
curl -X POST https://api.aivideoapi.ai/v1/videos/generations \
  -H "Authorization: Bearer sk-your-api-key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "minimax-h3",
    "callback_url": "https://your-server.com/webhook",
    "input": {
      "prompt": "Use the reference camera motion while keeping the product identity and matching the reference voice",
      "generation_type": "omni_reference",
      "image_urls": ["https://example.com/product.png"],
      "video_urls": ["https://example.com/camera-motion.mp4"],
      "audio_urls": ["https://example.com/voice.mp3"],
      "resolution": "2k",
      "duration": 8,
      "aspect_ratio": "adaptive"
    }
  }'
典型应用场景
广告与品牌活动
电商产品视频
产品设计可视化
UI 与网站动态概念
游戏场景与界面动画
电影片头
动态海报
参考引导的内容编辑

为什么选择 MiniMax H3

开发者关心的 MiniMax H3 API 优势。

Contextual Omni Representation

MiniMax 将 H3 的指令理解基础称为 Contextual Omni Representation。语言用于连接目标视频和多个上下文素材,并描述素材之间的关系,使一个请求可以组合镜头运动、角色图片和声音参考等开放式指令。

H3-VAE 架构效率

H3-VAE tokenizer 围绕重建质量、易学性和高压缩率重新设计。MiniMax 表示其带来 4 倍有效序列长度收益,降低训练与推理成本,并为原生 2K 生成提供技术基础,而不只是依赖传统后期超分。

H3-Omni Transformer

H3-Omni Transformer 面向任务泛化和多模态工作负载效率设计。MiniMax 在训练中拆分理解与生成负载并进行联合均衡,官方文字说明称端到端训练吞吐提升接近 30%。

In-context Regeneration

H3 在生成 2K 结果时,会结合原始多模态上下文重新生成自身的低分辨率输出。模型可以再次利用提示词与参考细节完成高分辨率渲染,减少传统独立超分对小文字和细节进行猜测的问题。

常见问题

关于 MiniMax H3 API 的常见问题解答。

MiniMax H3 API 是什么?

MiniMax H3 API 是 AI Video API 面向 MiniMax H3 提供的异步 REST 接入。H3 是通用全模态视频模型,接受必填提示词和可选的图片、视频、音频上下文,也支持使用一到两张图片控制首尾帧。请求统一发送到 POST /v1/videos/generations,model 固定为 minimax-h3;接口立即返回任务 ID,并通过轮询或回调提供托管视频结果。

MiniMax H3 支持哪些生成模式?

omni_reference 可用于文生视频,或组合任意受支持的图片、视频和音频参考。first_and_last_frames 用于首尾帧生成,此时 image_urls 传入首帧和可选尾帧,不能混用视频或音频。纯文生视频默认 16:9 且不能使用 adaptive;参考模式可以使用 adaptive,首尾帧模式则跟随输入图片尺寸。

MiniMax H3 视频 API 有哪些参考素材限制?

全模态参考模式最多支持 9 张图片、3 个视频和 3 个音频 URL。每个参考视频必须为 2–15 秒,所有参考视频合计不超过 15 秒。音频不能作为唯一参考素材,audio_urls 必须同时搭配至少一张图片或一个视频。所有参考必须是公网 HTTP(S) URL,本接口不接受 Data URI 或 MiniMax 私有文件标识。

MiniMax H3 如何计费?

768p 输出视频和输入参考视频均为每秒 22 积分;2K 均为每秒 34 积分。因此,5 秒 2K 文生视频消耗 170 积分;如果同一请求包含 12 秒参考视频,则按 17 秒乘以 34 积分计费,共 578 积分。前 5 张参考图片免费,第 6 张起每张 9 积分,参考音频免费。

MiniMax H3 会同时生成音频吗?

会。MiniMax 官方将 H3 描述为联合生成视频和原生双声道声音,而不是把人声、音效和音乐拆成互不相关的系统。在 omni_reference 模式下,可添加最多三个 MP3 或 WAV 音频参考来引导人声、音乐或音效,但请求必须同时包含至少一个图片或视频参考。当前 AI Video API 计费公式不对参考音频额外收费。

MiniMax H3 可以迁移参考视频的动作吗?

可以。MiniMax 官方文字说明将 V2V Motion Transfer 列为 H3 的重点能力。把公网 MP4 或 MOV 文件放入 video_urls,并在提示词中说明需要复用的动作、镜头运动、节奏或表演。还可以同时加入图片参考以控制主体或视觉身份,加入音频参考以控制声音意图;服务端会先探测所有参考视频时长并校验 15 秒合计上限。

提交 MiniMax H3 请求后会发生什么?

平台会校验输入、按需探测参考视频时长、计算费用并提交异步 MiniMax 任务。任务状态依次为 pending、processing,最后进入 completed 或 failed。可以轮询 GET /v1/tasks/{taskId},也可以提供 callback_url。成功结果会从 MiniMax 临时下载地址转存到平台存储后再写入 output.urls;生成失败会全额退还积分。

团队如何使用 MiniMax H3 制作商业内容?

建议在提示词中明确每个参考素材的作用,不要只堆叠互不关联的文件。MiniMax 将 H3 定位于广告、品牌、电商、产品设计、UI/UX、游戏、电影片头和动态海报等场景,并重点强调指令遵循、文字和品牌呈现以及可控的多模态编辑。探索方向时可先生成短时长 768p 草稿,再将筛选后的提示词和参考素材用于 2K 最终输出。

定价与用量

清晰的模型选项,共享积分余额。

768p 输出与输入视频
22 积分/秒

按输出时长与探测到的参考视频时长合计计费

2K 输出与输入视频
34 积分/秒

默认分辨率;输出与参考视频秒数使用同一单价

参考图片
前 5 张免费

第 6 张起每张 9 积分

参考音频
免费

最多三个音频 URL,需搭配图片或视频参考

在 AI Video API 上开始使用 MiniMax H3。

一个 API Key、一份积分余额,在视频和图片模型之间无缝切换,无需为每家供应商单独接入。

阅读文档