支持的模型
目前仅 Gemini 对话模型、GLM 视觉模型和豆包Seed对话模型支持原生的 PDF 文件对话,包括:gemini-3.1-pro-previewgemini-3.1-pro-preview:fast-thinkinggemini-3.1-flash-lite-previewgemini-3-flash-previewgemini-3-flash-preview:no-thinkinggemini-2.5-progemini-2.5-pro:fast-thinkinggemini-2.5-flashgemini-2.5-flash:no-thinkinggemini-2.5-flash-litegemini-2.5-flash-lite:no-thinkinggemini-2.0-flashgemini-2.0-flash-litegemini-2.5-flash-preview-09-2025gemini-2.5-flash-lite-preview-09-2025glm-5v-turboglm-4.6vglm-4.5vdoubao-seed-2.0-minidoubao-seed-2.0-litedoubao-seed-2.0-prodoubao-seed-2.0-codedoubao-seed-1.8doubao-seed-1.6-flashdoubao-seed-1.6doubao-seed-1.6-visiondoubao-seed-1.6-litedoubao-seed-code-preview
- 分析和解读内容,包括文本、图像、图表和表格,支持长达 1000 页的文档
- 将信息提取为结构化输出格式
- 基于文档的视觉和文本元素进行总结并回答问题
- 转录文档内容(例如转录为 HTML),保留其布局和格式,以便在下游应用程序中使用
PDF 对话
单文件 以下是单文件 PDF 文件对话请求示例:curl
file_url 对象传入到 content 列表即可:
curl
仅 Gemini 模型需要传入
mime_type 字段来指定文件类型,其他模型不需要传入该字段。纯文本文件对话
除了 PDF 文件外,Gemini 视觉模型还支持以下纯文本格式文件对话:- JavaScript,对应
mime_type为text/javascript - Python,对应
mime_type为text/x-python - TXT,对应
mime_type为text/plain - HTML,对应
mime_type为text/html - CSS,对应
mime_type为text/css - Markdown,对应
mime_type为text/markdown - CSV,对应
mime_type为text/csv - XML,对应
mime_type为text/xml - RTF,对应
mime_type为text/rtf
url 然后将 mime_type 改为 text/markdown 即可:
curl
Office 文件对话
目前仅部分 GLM 视觉模型支持原生的 Office 文件对话,包括 Word、Excel、PPT:glm-5v-turboglm-4.6vglm-4.5v
mime_type 替换为对应的 Office 文件类型即可:
curl
其他模型
不支持文件对话或者不支持对应格式文件对话的模型,请通过文件上传/读取接口先获取文件内容,再将文件内容作为对话上下文进行文件对话,该接口支持多种格式文档,包括 PDF、Office、纯文本等。 下面我们以 DeepSeek-V4-Flash 和 PDF 文件对话为例进行演示。 文件预处理 先通过文件上传接口将 PDF 文件上传并获取文件 ID:curl
uuid 字段就是文件的唯一标识符,然后通过文件读取接口获取 PDF 文件内容:
curl
status 为 done 时,响应字段 content 就是 PDF 文件的文本内容了。
LLM文件对话
将获取到的 PDF 文件内容作为对话上下文进行对话:
curl
