支持的模型
目前极客智坊支持的在对话中进行视频分析的 AI 模型如下,主要是 Gemini 模型、GLM视觉模型、最新千问和豆包模型:gemini-3.1-pro-previewgemini-3.1-pro-preview:fast-thinkinggemini-3.1-flash-lite-previewgemini-3-flash-previewgemini-3-flash-preview:no-thinkinggemini-2.5-progemini-2.5-pro:fast-thinkinggemini-2.5-flashgemini-2.5-flash:no-thinkinggemini-2.5-flash-litegemini-2.0-flashgemini-2.0-flash-litegemini-2.5-flash-lite:no-thinkinggemini-2.5-flash-preview-09-2025gemini-2.5-flash-lite-preview-09-2025glm-5v-turboglm-4.6vglm-4.5vqwen3.5-flashqwen3.5-plusqwen3.5-397b-a17bqwen3.5-35b-a3bqwen3.5-27bqwen3.5-122b-a10bqwen3.5-omni-flashqwen3.5-omni-plusqwen3.6-plusqwen3.6-flashqwen3.6-35b-a3bqwen3.6-27bdoubao-seed-2.0-minidoubao-seed-2.0-litedoubao-seed-2.0-prodoubao-seed-2.0-codedoubao-seed-1.8doubao-seed-1.6-flashdoubao-seed-1.6doubao-seed-1.6-visiondoubao-seed-1.6-litedoubao-seed-code-preview
视频处理能力包括:
- 描述、分割视频并提取信息
- 回答关于视频内容的问题
- 参考视频中的具体时间点
视频格式和尺寸
Gemini 支持以下视频格式 MIME 类型:video/mp4video/mpegvideo/movvideo/avivideo/x-flvvideo/mpgvideo/webmvideo/wmvvideo/3gpp
视频对话示例
基本示例 对于 Gemini 2.5 以前的版本,每次请求只能上传一个视频:curl
MM:SS 格式的时间戳,询问视频中特定时间点的问题:
curl
curl
在生成视觉描述时,模型会以每秒 1 帧的速率对视频进行采样,此采样速率可能会影响描述的详细程度,尤其是在视觉变化快速的视频中。
curl
- 单帧:默认每帧为 258 Token
- 音频:每秒 32 token
- 元数据也会参与统计
prompt_tokens 参与计费。