Skip to main content
推理模型在生成回答前会先进行 内部思考,在数学、代码、规划、逻辑题等任务上显著强于普通模型,但延迟与成本也更高。

支持的模型

OpenAI

通过模型 ID

通过参数(Responses API)

注意:
  • 推理模型 不支持 temperaturetop_ppresence_penalty 等部分参数。
  • 使用 max_completion_tokens(新)而非 max_tokens
  • reasoning_tokens 不可见但会计费,务必留足预算。

Claude

  • budget_tokens:思考预算上限,典型 1024-32000。
  • 思考块默认 可见 —— 与 OpenAI 不同,你可以读到推理过程。
  • 计费:thinking_tokens 按输出价格 额外 计费。

Gemini

或使用预置 ID:

什么时候用推理模型

✅ 适合

  • 数学证明、复杂逻辑题
  • 代码重构、Bug 定位
  • 多步骤规划、Agent 决策
  • 长文档分析、研究综述

❌ 不必

  • 普通问答、闲聊
  • 翻译、摘要、改写
  • 简单分类、信息抽取

计费提醒

  • 推理 token 不在 content 中显示 但仍按输出价格扣费。
  • 控制台日志会拆分展示 thinking / answer 两部分。
  • 设置 max_completion_tokens / max_output_tokens务必留足(建议 ≥ 4096),否则可能因 token 耗尽返回空答案。

流式

推理模型可以流式输出,但 思考阶段没有 delta 内容,客户端会先看到一段空白(可能数秒),然后才开始接收答案。 建议在 UI 上加 loading 状态。Claude / Gemini 流式可以收到 thinking block 的 delta,实现 “思考过程可视化”。