> ## Documentation Index
> Fetch the complete documentation index at: https://docs.geekai.co/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMax-H3

MiniMax H3 是一款通用的全模态生成模型，支持对文本、图像、视频、声音组成的多模态上下文的统一理解能力、能够输出具备原生双声道的音视频，最高可支持 15s 2K 分辨率。

根据前期的邀测反馈，MiniMax H3 具备商用级的多场景内容生成能力，在指令遵循、文字与品牌信息呈现、V2V Motion Transfer（视频到视频动作迁移）等方面表现出色，可实现精准、可控的多模态内容编辑与生成，广泛适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。

### 模型参数

* 模型ID：`MiniMax-H3`
* 模型价格：你可以在[模型详情页](https://geekai.co/models/MiniMax-H3)查看最新价格信息
* 调用入口：`https://geekai.co/api/v1/videos/generations`
* 模型参数：参考[视频 API 手册](https://docs.geekai.co/cn/api/video/generations)
* API认证：[获取 API KEY](https://geekai.co/user/api_keys)

<Note>
  不支持视频 API 中的以下参数：

  * `negative_prompt`
  * `with_audio`（H3 生成的视频默认带音频）
  * `fps`
  * `quality`
  * `size`

  附：[MiniMax H3 官方 API 文档](https://platform.minimaxi.com/docs/api-reference/video-generation-v2-create)
</Note>

极客智坊使用视频生成接口通用的提示词、首尾帧、参考图、参考视频和参考音频传参，和官方有差异，不过可以和官方完全对齐：

* `prompt`：文本提示词，支持中文和英文，最大支持7000字符；
* `image`：首帧图片，支持 URL 或 Base64 编码的图片数据；
* `image_tail`：尾帧图片，支持 URL 或 Base64 编码的图片数据；
* `images`：参考图片，最多支持9张，通过数组传递，支持 URL 或 Base64 编码的图片数据；
* `video`：参考视频，最多支持3个，多个参考视频通过数组传递，仅支持 URL；
* `audio`：参考音频，最多支持3个，多个参考音频通过数组传递，仅支持 URL，不支持单独传参考音频必须配合参考图或参考视频。

MiniMax H3 支持的 `resolution` 分辨率为 `768P` 和 `2K`，默认值是 `768P`。

MiniMax H3 支持的 `duration` 视频时长为 4-15s，默认 5s。

MiniMax H3 支持的 `aspect_ratio` 参数取值范围如下：、

* `1:1`
* `16:9`
* `4:3`
* `3:4`
* `9:16`
* `21:9`
* `adaptive`：自适应

文生视频不支持 `adaptive`，首尾帧图生视频仅支持 `adaptive`（默认值），其他配置无效，参考生视频则支持所有取值。

MiniMax H3 支持的 `watermark` 参数用于控制生成视频是否带有水印，`watermark` 的取值范围是 `true` 和 `false`，默认值是 `false`，表示不带水印。

### 模型价格

MiniMax H3 生成视频按时长和分辨率计费，以下是 MiniMax H3 的价格表：

| 分辨率（resolution） | 价格（单位：元/秒） |
| --------------- | ---------- |
| 768P            | 0.5        |
| 2K              | 0.8        |

其他计费项：

* 包含参考图时，参考图片张数在5张以内免费，超过5张的部分每张加收0.2元；
* 包含参考视频时，参考视频时长会和输出视频时长累加计费，单价不变。

使用极客智坊提供的[低价代理渠道](https://docs.geekai.co/cn/docs/model_price)调用时，不同参数对应价格按照价格表x对应的折扣值即可：以高可用Pro渠道为例，折扣值是 `0.8`，那么生成一段分辨率为 `768P`、时长为 `6` 秒的视频价格是 `0.5 x 6 x 0.8 = 2.4` 元，如果生成同样时长但分辨率为 `2K` 的视频价格是 `0.8 x 6 x 0.8 = 3.84` 元。渠道折扣也适用于其他计费项。

### 文生视频

通过文字描述来生成对应视频：

```bash theme={null}
curl --location --request POST 'https://geekai.co/api/v1/videos/generations' \
--header 'Content-Type: application/json' \
--header 'Authorization: Bearer $GEEKAI_API_KEY' \
--data '{
    "model":"MiniMax-H3",
    "prompt": "小猫对着镜头打哈欠",
    "async": true
}'
```

响应是一个 JSON 对象，包含生成视频的任务 ID，你可以通过 [视频查询接口](https://docs.geekai.co/cn/api/video/result) 轮询视频生成状态，状态值为 `succeed` 时，表示视频生成成功，响应中会返回视频 URL。

### 图生视频

**首帧**

通过 `image` 传入单图即可实现基于首帧生成视频：

```bash theme={null}
curl --location --request POST 'https://geekai.co/api/v1/videos/generations' \
--header 'Content-Type: application/json' \
--header 'Authorization: Bearer $GEEKAI_API_KEY' \
--data '{
    "model":"MiniMax-H3",
    "prompt":"老鼠跑向镜头前，微笑着眨了眨眼睛",
    "image":"https://cdn.hailuoai.com/prod/2024-09-18-16/user/multi_chat_file/9c0b5c14-ee88-4a5b-b503-4f626f018639.jpeg",
    "async": true
}'
```

**首尾帧**

通过 `image` + `image_tail` 传入首尾两张图即可实现基于首尾帧生成视频：

```bash theme={null}
curl --location --request POST 'https://geekai.co/api/v1/videos/generations' \
--header 'Content-Type: application/json' \
--header 'Authorization: Bearer $GEEKAI_API_KEY' \
--data '{
    "model":"MiniMax-H3",
    "prompt":"一个小女孩从小成长到大的变化",
    "image":"https://filecdn.minimax.chat/public/fe9d04da-f60e-444d-a2e0-18ae743add33.jpeg",
    "image_tail":"https://filecdn.minimax.chat/public/97b7cd08-764e-4b8b-a7bf-87a0bd898575.jpeg",
    "duration": 8,
    "async": true
}'
```

### 参考生视频

MiniMax H3 支持基于参考图+视频+音频生成视频。

**参考图**

通过 `images` 传入一张或多张图即可实现基于多张参考图生成视频：

```bash theme={null}
curl --location --request POST 'https://geekai.co/api/v1/videos/generations' \
--header 'Content-Type: application/json' \
--header 'Authorization: Bearer $GEEKAI_API_KEY' \
--data '{
    "model": "MiniMax-H3",
    "prompt": "@图1戴着眼镜穿着蓝色T恤的男生和@图2的柯基小狗，坐在@图3的草坪上，3D卡通风格",
    "images": [
        "https://ark-project.tos-cn-beijing.volces.com/doc_image/seelite_ref_1.png",
        "https://ark-project.tos-cn-beijing.volces.com/doc_image/seelite_ref_2.png",
        "https://ark-project.tos-cn-beijing.volces.com/doc_image/seelite_ref_3.png"
    ],
    "async": true
}'
```

**多模态参考**

你可以同时传入参考图、参考视频和参考音频来生成视频，实现多模态参考（最多支持9张参考图+3个参考视频+3个参考音频）：

```bash theme={null}
curl --location --request POST 'https://geekai.co/api/v1/videos/generations' \
--header 'Content-Type: application/json' \
--header 'Authorization: Bearer $GEEKAI_API_KEY' \
--data '{
    "model": "MiniMax-H3",
    "prompt": "全程使用视频1的第一视角构图，全程使用音频1作为背景音乐。第一人称视角果茶宣传广告，极客智坊牌「苹苹安安」苹果果茶限定款；首帧为图片1，你的手摘下一颗带晨露的阿克苏红苹果，轻脆的苹果碰撞声；2-4 秒：快速切镜，你的手将苹果块投入雪克杯，加入冰块与茶底，用力摇晃，冰块碰撞声与摇晃声卡点轻快鼓点，背景音：「鲜切现摇」；4-6 秒：第一人称成品特写，分层果茶倒入透明杯，你的手轻挤奶盖在顶部铺展，在杯身贴上粉红包标，镜头拉近看奶盖与果茶的分层纹理；6-8 秒：第一人称手持举杯，你将图片2中的果茶举到镜头前（模拟递到观众面前的视角），杯身标签清晰可见，背景音「来一口鲜爽」，尾帧定格为图片2。背景声音统一为女生音色。",
    "images": [
        "https://ark-project.tos-cn-beijing.volces.com/doc_image/r2v_tea_pic1.jpg",
        "https://ark-project.tos-cn-beijing.volces.com/doc_image/r2v_tea_pic2.jpg"
    ],
    "video": [
        "https://ark-project.tos-cn-beijing.volces.com/doc_video/r2v_tea_video1.mp4"
    ],
    "audio": [
        "https://ark-project.tos-cn-beijing.volces.com/doc_audio/r2v_tea_audio1.mp3"
    ],
    "aspect_ratio": "16:9",
    "duration": 10,
    "async": true
}'
```

<Note>
  多模态传入参数图片、视频、音频时，支持以下组合：

  * 文本
  * 文本 + 图片
  * 文本 + 视频
  * 文本 + 图片 + 音频
  * 文本 + 图片 + 视频
  * 文本 + 视频 + 音频
  * 文本 + 图片 + 视频 + 音频

  不能仅传入音频不带图片或视频，否则会报错。
</Note>
