Skip to main content

什么是后台模式

后台模式是指在对话过程中,用户可以选择不立即等待模型的回复,而是让模型在后台处理请求,稍后再获取结果。这种模式适用于需要较长时间处理的任务,如画图、复杂推理、深度研究或多轮对话等。
典型的耗时任务模型如下:
  • o1
  • o1-pro
  • o3
  • o3-pro
  • gpt-5 复杂推理
  • gpt-5-pro
  • gpt-5-codex
  • gemini-2.5-flash 复杂推理
  • gemini-2.5-flash-image
  • gemini-2.5-pro
  • 所有模型ID中带 sonar 前缀的对话模型(需要联网搜索)
  • 所有模型ID中带 thinking 后缀的推理模型(注意不是 no-thinking),如 Claude、DeepSeek 等
  • 所有模型ID中带 search 字样的联网搜索对话模型
  • 所有模型ID中带 research 字样的深度研究推理模型
  • OpenAI 系列使用了搜索web_search)、画图image_generation)工具的对话模型
  • 所有其他内置联网搜索并开启以及使用了外部搜索工具的对话模型
  • 所有其他在对话中支持画图、语音的对话模型
当然如果你在使用其他对话模型时觉得响应较慢,也可以使用后台模式。目前仅对话完成接口非流式对话支持后台模式,画图、视频模型可以通过对应的异步模式实现后台模式。

启用后台模式对话

要使用后台模式,您需要在对话请求中设置 background 参数为 true。以下是一个示例请求:
目前仅对话完成接口非流式对话支持后台模式,所以不同同时设置 streambackgroundtrue,否则会导致请求失败:

获取后台模式结果

一旦发起了一个后台模式的请求,将收到一个响应,其中包含一个唯一的 id 用于标识本次对话任务:
你可以使用这个 id 通过对话结果查询接口查询任务的状态和结果:
将上面接口路径中的 {id} 替换为你收到的任务 id 发起查询请求即可,在本例中,就是 4ec88c8a-9ef9-496d-bec8-711521a1c693。查询结果可能有以下几种状态:
  • pending:任务仍在排队中
  • running:任务正在处理中
  • succeed:任务处理成功
如果任务执行成功,则响应和非后台模式的对话完成接口响应格式相同:
按照非流式对话完成接口进行 JSON 反序列化即可获取响应结果。
任务结果默认会保留 7 天,7 天后任务结果将被自动删除,请及时查询和保存结果。
如果任务执行失败,则错误响应和原来非流式对话完成接口响应格式相同,你可以根据错误码和错误信息进行排查和处理。