Skip to main content
MiniMax H3 是一款通用的全模态生成模型,支持对文本、图像、视频、声音组成的多模态上下文的统一理解能力、能够输出具备原生双声道的音视频,最高可支持 15s 2K 分辨率。 根据前期的邀测反馈,MiniMax H3 具备商用级的多场景内容生成能力,在指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)等方面表现出色,可实现精准、可控的多模态内容编辑与生成,广泛适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。

模型参数

不支持视频 API 中的以下参数:
  • negative_prompt
  • with_audio(H3 生成的视频默认带音频)
  • fps
  • quality
  • size
附:MiniMax H3 官方 API 文档
极客智坊使用视频生成接口通用的提示词、首尾帧、参考图、参考视频和参考音频传参,和官方有差异,不过可以和官方完全对齐:
  • prompt:文本提示词,支持中文和英文,最大支持7000字符;
  • image:首帧图片,支持 URL 或 Base64 编码的图片数据;
  • image_tail:尾帧图片,支持 URL 或 Base64 编码的图片数据;
  • images:参考图片,最多支持9张,通过数组传递,支持 URL 或 Base64 编码的图片数据;
  • video:参考视频,最多支持3个,多个参考视频通过数组传递,仅支持 URL;
  • audio:参考音频,最多支持3个,多个参考音频通过数组传递,仅支持 URL,不支持单独传参考音频必须配合参考图或参考视频。
MiniMax H3 支持的 resolution 分辨率为 768P2K,默认值是 768P MiniMax H3 支持的 duration 视频时长为 4-15s,默认 5s。 MiniMax H3 支持的 aspect_ratio 参数取值范围如下:、
  • 1:1
  • 16:9
  • 4:3
  • 3:4
  • 9:16
  • 21:9
  • adaptive:自适应
文生视频不支持 adaptive,首尾帧图生视频仅支持 adaptive(默认值),其他配置无效,参考生视频则支持所有取值。 MiniMax H3 支持的 watermark 参数用于控制生成视频是否带有水印,watermark 的取值范围是 truefalse,默认值是 false,表示不带水印。

模型价格

MiniMax H3 生成视频按时长和分辨率计费,以下是 MiniMax H3 的价格表: 其他计费项:
  • 包含参考图时,参考图片张数在5张以内免费,超过5张的部分每张加收0.2元;
  • 包含参考视频时,参考视频时长会和输出视频时长累加计费,单价不变。
使用极客智坊提供的低价代理渠道调用时,不同参数对应价格按照价格表x对应的折扣值即可:以高可用Pro渠道为例,折扣值是 0.8,那么生成一段分辨率为 768P、时长为 6 秒的视频价格是 0.5 x 6 x 0.8 = 2.4 元,如果生成同样时长但分辨率为 2K 的视频价格是 0.8 x 6 x 0.8 = 3.84 元。渠道折扣也适用于其他计费项。

文生视频

通过文字描述来生成对应视频:
响应是一个 JSON 对象,包含生成视频的任务 ID,你可以通过 视频查询接口 轮询视频生成状态,状态值为 succeed 时,表示视频生成成功,响应中会返回视频 URL。

图生视频

首帧 通过 image 传入单图即可实现基于首帧生成视频:
首尾帧 通过 image + image_tail 传入首尾两张图即可实现基于首尾帧生成视频:

参考生视频

MiniMax H3 支持基于参考图+视频+音频生成视频。 参考图 通过 images 传入一张或多张图即可实现基于多张参考图生成视频:
多模态参考 你可以同时传入参考图、参考视频和参考音频来生成视频,实现多模态参考(最多支持9张参考图+3个参考视频+3个参考音频):
多模态传入参数图片、视频、音频时,支持以下组合:
  • 文本
  • 文本 + 图片
  • 文本 + 视频
  • 文本 + 图片 + 音频
  • 文本 + 图片 + 视频
  • 文本 + 视频 + 音频
  • 文本 + 图片 + 视频 + 音频
不能仅传入音频不带图片或视频,否则会报错。