Skip to main content

支持的模型

目前极客智坊支持的在对话中进行视频分析的 AI 模型如下,主要是 Gemini 模型、GLM视觉模型、最新千问和豆包模型:
  • gemini-3.1-pro-preview
  • gemini-3.1-pro-preview:fast-thinking
  • gemini-3.1-flash-lite-preview
  • gemini-3-flash-preview
  • gemini-3-flash-preview:no-thinking
  • gemini-2.5-pro
  • gemini-2.5-pro:fast-thinking
  • gemini-2.5-flash
  • gemini-2.5-flash:no-thinking
  • gemini-2.5-flash-lite
  • gemini-2.0-flash
  • gemini-2.0-flash-lite
  • gemini-2.5-flash-lite:no-thinking
  • gemini-2.5-flash-preview-09-2025
  • gemini-2.5-flash-lite-preview-09-2025
  • glm-5v-turbo
  • glm-4.6v
  • glm-4.5v
  • qwen3.5-flash
  • qwen3.5-plus
  • qwen3.5-397b-a17b
  • qwen3.5-35b-a3b
  • qwen3.5-27b
  • qwen3.5-122b-a10b
  • qwen3.5-omni-flash
  • qwen3.5-omni-plus
  • qwen3.6-plus
  • qwen3.6-flash
  • qwen3.6-35b-a3b
  • qwen3.6-27b
  • doubao-seed-2.0-mini
  • doubao-seed-2.0-lite
  • doubao-seed-2.0-pro
  • doubao-seed-2.0-code
  • doubao-seed-1.8
  • doubao-seed-1.6-flash
  • doubao-seed-1.6
  • doubao-seed-1.6-vision
  • doubao-seed-1.6-lite
  • doubao-seed-code-preview
你也可以在模型广场中通过模型功能->视频理解进行筛选,获取所有支持视频理解的对话模型: 在极客智坊模型广场筛选支持视频理解的对话模型 视频处理能力包括:
  • 描述、分割视频并提取信息
  • 回答关于视频内容的问题
  • 参考视频中的具体时间点
下面我们以 Gemini 模型为例,介绍一下视频分析的使用方法和注意事项,其他模型也是类似的。

视频格式和尺寸

Gemini 支持以下视频格式 MIME 类型:
  • video/mp4
  • video/mpeg
  • video/mov
  • video/avi
  • video/x-flv
  • video/mpg
  • video/webm
  • video/wmv
  • video/3gpp
且上传视频 URL 必须是公网可访问的 URL。 在文件尺寸方面,Gemini 最大支持 2GB 文件,在视频时长方面,以上支持视频分析的 Gemini 模型(1M上下文)可处理长达 1 小时的视频。

视频对话示例

基本示例 对于 Gemini 2.5 以前的版本,每次请求只能上传一个视频:
curl
时间戳 您可以通过 MM:SS 格式的时间戳,询问视频中特定时间点的问题:
curl
转录视频并提供视觉描述 Gemini 模型能够通过处理视频的音频轨道和视觉帧来转录视频内容并提供视觉描述:
curl
在生成视觉描述时,模型会以每秒 1 帧的速率对视频进行采样,此采样速率可能会影响描述的详细程度,尤其是在视觉变化快速的视频中。
多个视频 对于 Gemini 2.5 及以后的版本,可以在一次请求中上传多个视频进行分析,最多可以上传 10 个:
curl
尽管如此,对于复杂任务,为获得最佳效果,每次提示请求请仅使用一个视频。 视频对话响应结果和普通的文本对话一样:
额外费用 视频的每一秒都会被进行 Token 化处理,具体如下:
  • 单帧:默认每帧为 258 Token
  • 音频:每秒 32 token
  • 元数据也会参与统计
所以折算下来,视频每秒对应约 300 token,这将作为 prompt_tokens 参与计费。