提示缓存(降低重复前缀费用)
长系统提示、知识库、工具说明等稳定前缀可写入提示缓存,后续同前缀请求按缓存输入计价并通常更快。模型族不同,协议不同——选错路径是「开了缓存却命中为 0」的最常见原因。Claude / GPT 与各品牌说明见本节下文。
清单对齐模型目录中的 Claude 与 GPT 文本模(不含 gpt-image-*)。须在应用模型权限中启用后方可调用。
不含出图模(gpt-image-*)。OpenAI o3/o4 等推理系不在本 GPT 表;若已开通,缓存协议以官方自动缓存说明为准。
协议对照
| 模型族 | 必须用 | 路径 | 不要用 |
|---|
| Claude(全部在售文本模) | Messages API + cache_control | POST https://lingfengtoken.com/api/claude/v1/messages | 请勿使用 Chat Completions 验证 Claude 提示缓存 |
| GPT-5.6(luna / sol / terra) | Responses + prompt_cache_*(显式或隐式) | POST https://api.lingfengtoken.com/v1/responses | GPT-5.6 提示缓存请走 Responses,不要用 Chat Completions |
| GPT-5.5 及更早 GPT 文本模 | 自动前缀缓存(默认可命中;retention/key 为可选项) | Chat 或 Responses(Codex/Pro 须 Responses) | 不要发送 prompt_cache_options / prompt_cache_breakpoint |
| 通义 Qwen(文本) | 隐式自动,或显式 content.cache_control ephemeral | POST /v1/chat/completions | 显式与隐式同一请求不能混用 |
| DeepSeek(文本) | 默认磁盘前缀缓存(无需开关字段) | POST /v1/chat/completions | 前缀须稳定且与上次完全一致 |
| Kimi(文本) | 默认自动前缀缓存 | POST /v1/chat/completions | 短前缀可能不入缓存;勿抄 GPT-5.6 断点 |
| Google Gemini(文本) | Chat Completions;看 prompt_tokens_details.cached_tokens | POST /v1/chat/completions | 文本勿使用 generateContent;勿调用 cachedContents |
| 豆包 Seed(文本) | Chat Completions;稳定前缀;官方另有 Context/Responses 缓存 | POST /v1/chat/completions | 不要套用 Claude / GPT-5.6 显式断点字段 |
| 智谱 GLM(文本) | 隐式缓存;看 prompt_tokens_details.cached_tokens | POST /v1/chat/completions | 前缀须字节级一致 |
| xAI Grok(文本) | 自动前缀缓存;可选 prompt_cache_key / x-grok-conv-id | POST /v1/chat/completions | 多轮勿改历史消息 |
| MiniMax(文本) | Chat Completions;稳定前缀并完整回传 assistant | POST /v1/chat/completions | 不要丢弃思考相关字段后再多轮 |
Claude 文本模(全量)
| 模型 ID | 最小前缀 token | 路径 | 状态 | 说明 |
|---|
| claude-fable-5 | 512 | POST /claude/v1/messages | 按官方公开协议 | cache_control ephemeral(可选 ttl 5m/1h) |
| claude-haiku-4-5 | 4096 | POST /claude/v1/messages | 按官方公开协议 | 官方 Haiku 4.5 门槛较高 |
| claude-opus-4-5 | 4096 | POST /claude/v1/messages | 按官方公开协议 | 官方 Opus 4.5 |
| claude-opus-4-6 | 4096 | POST /claude/v1/messages | 按官方公开协议 | 官方 Opus 4.6 |
| claude-opus-4-7 | 2048 | POST /claude/v1/messages | 按官方公开协议 | 官方 Opus 4.7 |
| claude-opus-4-8 | 1024 | POST /claude/v1/messages | 按官方公开协议 | 官方 Opus 4.8 |
| claude-sonnet-4-5 | 1024 | POST /claude/v1/messages | 按官方公开协议 | 官方 Sonnet 4.5 |
| claude-sonnet-4-6 | 1024 | POST /claude/v1/messages | 按官方公开协议 | 官方 Sonnet 4.6 |
| claude-sonnet-5 | 1024 | POST /claude/v1/messages | 按官方公开协议 | 官方 Sonnet 5 |
GPT 文本模(全量)
| 模型 ID | 最小前缀 token | 路径 | 状态 | 说明 |
|---|
| gpt-5.6-luna | 1024 | POST /v1/responses | 按官方公开协议 | 显式:prompt_cache_key + options + breakpoint;ttl 仅 30m |
| gpt-5.6-sol | 1024 | POST /v1/responses | 按官方公开协议 | 显式:prompt_cache_key + options + breakpoint;请走 Responses |
| gpt-5.6-terra | 1024 | POST /v1/responses | 按官方公开协议 | 同 sol 显式协议 |
| gpt-5.5 | 约 1024–2048(随模型) | Chat 或 Responses(Codex/Pro 等无 Chat 通道者须 Responses) | 按官方公开协议 | 自动缓存(默认可命中);key/retention 可选;gpt-5.5 仅 24h |
| gpt-5.4 | 约 1024–2048(随模型) | Chat 或 Responses(Codex/Pro 等无 Chat 通道者须 Responses) | 按官方公开协议 | 自动缓存;官方 extended 名单含本 ID;门槛随设置约 1024–2048 |
| gpt-5.4-mini | 约 1024–2048(随模型) | Chat 或 Responses(Codex/Pro 等无 Chat 通道者须 Responses) | 按官方公开协议 | 自动缓存;未列入官方 24h extended 支持名单,retention 以实际为准 |
| gpt-5.4-nano | 约 1024–2048(随模型) | Chat 或 Responses(Codex/Pro 等无 Chat 通道者须 Responses) | 按官方公开协议 | 自动缓存;未列入官方 24h extended 支持名单,retention 以实际为准 |
| gpt-5.4-pro | 约 1024–2048(随模型) | POST /v1/responses | 按官方公开协议 | 调用面须 Responses;自动缓存;未列入官方 24h extended 支持名单 |
| gpt-5.3-codex | 约 1024–2048(随模型) | POST /v1/responses | 按官方公开协议 | Codex 须 Responses;自动缓存;未列入官方 24h extended 支持名单 |
| gpt-5.2 | 约 1024–2048(随模型) | Chat 或 Responses(Codex/Pro 等无 Chat 通道者须 Responses) | 按官方公开协议 | 自动缓存;官方 extended 名单含本 ID |
| gpt-5.2-chat | 约 1024–2048(随模型) | Chat 或 Responses(Codex/Pro 等无 Chat 通道者须 Responses) | 按官方公开协议 | 自动缓存;未列入官方 24h extended 支持名单 |
| gpt-5.2-codex | 约 1024–2048(随模型) | POST /v1/responses | 按官方公开协议 | Codex 须 Responses;自动缓存;未列入官方 24h extended 支持名单 |
| gpt-5.1 | 约 1024–2048(随模型) | Chat 或 Responses(Codex/Pro 等无 Chat 通道者须 Responses) | 按官方公开协议 | 自动缓存;官方 extended 名单含本 ID |
| gpt-5.1-codex | 约 1024–2048(随模型) | POST /v1/responses | 按官方公开协议 | Codex 须 Responses;官方 extended 名单含本 ID |
| gpt-5.1-codex-max | 约 1024–2048(随模型) | POST /v1/responses | 按官方公开协议 | Codex 须 Responses;官方 extended 名单含本 ID |
| gpt-5.1-codex-mini | 约 1024–2048(随模型) | POST /v1/responses | 按官方公开协议 | Codex 须 Responses;官方 extended 名单含本 ID |
| gpt-5 | 约 1024–2048(随模型) | Chat 或 Responses(Codex/Pro 等无 Chat 通道者须 Responses) | 按官方公开协议 | 自动缓存;官方 extended 名单含本 ID |
| gpt-5-codex | 约 1024–2048(随模型) | POST /v1/responses | 按官方公开协议 | Codex 须 Responses;官方 extended 名单含本 ID |
| gpt-5-mini | 约 1024–2048(随模型) | Chat 或 Responses(Codex/Pro 等无 Chat 通道者须 Responses) | 按官方公开协议 | 自动缓存;未列入官方 24h extended 支持名单 |
| gpt-5-nano | 约 1024–2048(随模型) | Chat 或 Responses(Codex/Pro 等无 Chat 通道者须 Responses) | 按官方公开协议 | 自动缓存;未列入官方 24h extended 支持名单 |
| gpt-5-pro | 约 1024–2048(随模型) | POST /v1/responses | 按官方公开协议 | 调用面须 Responses;自动缓存;未列入官方 24h extended 支持名单 |
| gpt-4.1 | 约 1024–2048(随模型) | Chat 或 Responses(Codex/Pro 等无 Chat 通道者须 Responses) | 按官方公开协议 | 自动缓存;官方 extended 名单含本 ID |
| gpt-4.1-mini | 约 1024–2048(随模型) | Chat 或 Responses(Codex/Pro 等无 Chat 通道者须 Responses) | 按官方公开协议 | 自动缓存;未列入官方 24h extended 支持名单 |
| gpt-4.1-nano | 约 1024–2048(随模型) | Chat 或 Responses(Codex/Pro 等无 Chat 通道者须 Responses) | 按官方公开协议 | 自动缓存;未列入官方 24h extended 支持名单 |
| gpt-chat-latest | 约 1024–2048(随模型) | Chat 或 Responses(Codex/Pro 等无 Chat 通道者须 Responses) | 按官方公开协议 | 别名跟随最新聊天模;按实际路由代际选自动/显式;勿假设恒为自动 |
model 必须与应用「模型权限」中的 ID 完全一致。缓存字段与命中情况以实际回包 usage 为准。
Claude:Messages + cache_control
- •完整 URL:https://lingfengtoken.com/api/claude/v1/messages
- •请求头:Authorization: Bearer sk-lf-…(Claude Code 亦可用 x-api-key);anthropic-version: 2023-06-01
- •两种官方写法:请求顶层 cache_control(自动断点),或内容块上 cache_control(显式断点);可组合,显式断点最多 4 个
- •type 仅支持 ephemeral;可选 ttl: "5m"(默认)或 "1h"
- •前缀长度须达到该模型最小可缓存 token(见上表;不足时官方静默不缓存、不报错);首笔看 usage.cache_creation_input_tokens;同前缀后续看 usage.cache_read_input_tokens
curl · Claude Messages 提示缓存
curl -X POST "https://lingfengtoken.com/api/claude/v1/messages" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-fable-5",
"max_tokens": 64,
"system": [
{
"type": "text",
"text": "You are an analyst. Stable instructions stay identical across requests.",
"cache_control": { "type": "ephemeral", "ttl": "5m" }
},
{
"type": "text",
"text": "REPLACE_WITH_LONG_STABLE_PREFIX_MEETING_MODEL_MINIMUM",
"cache_control": { "type": "ephemeral", "ttl": "5m" }
}
],
"messages": [
{ "role": "user", "content": "Summarize the major themes in one sentence." }
]
}'
GPT-5.6:Responses 显式提示缓存
- •适用:gpt-5.6-luna / gpt-5.6-sol / gpt-5.6-terra(目录别名;官方文档称 GPT-5.6 and later)
- •完整 URL:https://api.lingfengtoken.com/v1/responses(本平台 GPT-5.6 提示缓存请走 Responses)
- •官方支持 implicit 与 explicit;示例采用 explicit。显式模式须打 prompt_cache_breakpoint,否则不写也不读
- •建议设置稳定的 prompt_cache_key(官方:5.6 要用更可靠匹配时须带 key);prompt_cache_options.ttl 仅支持 "30m"
- •前缀经断点 ≥ 1024 token;首笔看 input_tokens_details.cache_write_tokens;后续看 cached_tokens
curl · GPT Responses 显式提示缓存
curl -X POST "https://api.lingfengtoken.com/v1/responses" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.6-sol",
"max_output_tokens": 16,
"prompt_cache_key": "demo-shared-prefix-v1",
"prompt_cache_options": { "mode": "explicit", "ttl": "30m" },
"input": [
{
"role": "developer",
"content": [
{
"type": "input_text",
"text": "REPLACE_WITH_LONG_STABLE_PREFIX_AT_LEAST_1024_TOKENS",
"prompt_cache_breakpoint": { "mode": "explicit" }
}
]
},
{
"role": "user",
"content": [
{ "type": "input_text", "text": "Reply with one word: ok" }
]
}
]
}'
GPT-5.5 及更早:自动提示缓存
- •适用:gpt-5.5 及更早 GPT 文本模(含 Codex / Pro / gpt-4.1* / gpt-chat-latest)
- •官方:更早代际为自动前缀缓存,不支持 prompt_cache_options / prompt_cache_breakpoint;发送后者可能 400
- •prompt_cache_key 为可选项(分组路由/对账),不是开缓存开关;不设 key 也可自动命中
- •prompt_cache_retention 为可选项:gpt-5.5 仅 "24h";部分更早模支持 "in_memory" 或 "24h"(下划线,不是 in-memory)
- •官方 extended retention 明确支持范围含:gpt-5.5、gpt-5.4、gpt-5.2、gpt-5.1*、gpt-5、gpt-5-codex、gpt-4.1 等;mini/nano/部分变体以实际报错为准
- •Codex、*-pro 等无 Chat 通道的模型:调用与缓存观测都走 POST /v1/responses
- •成功看 usage 中的 cached_tokens;更早代际通常无独立 cache_write 计费字段
通义 / DeepSeek / Kimi:是否开通以控制台模型权限为准;model 须与权限 ID 完全一致。
通义 Qwen:隐式 / 显式缓存
- •路径:POST https://api.lingfengtoken.com/v1/chat/completions
- •隐式与显式同一请求只能用一种。可缓存前缀通常 ≥ 1024 token
- •隐式:无需额外字段。把稳定长前缀放在 messages 靠前,系统自动识别公共前缀
- •显式:把要缓存的 content 改成数组,并加 "cache_control": {"type": "ephemeral"}。从 messages 开头缓存到该标记;有效期约 5 分钟,命中可续期;单次请求最多 4 个标记
- •回包:usage.prompt_tokens_details.cached_tokens;显式创建时看 cache_creation_input_tokens
curl · 通义显式 cache_control
curl -X POST "https://api.lingfengtoken.com/v1/chat/completions" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"max_tokens": 64,
"messages": [
{
"role": "system",
"content": [
{
"type": "text",
"text": "REPLACE_WITH_STABLE_PREFIX_AT_LEAST_1024_TOKENS",
"cache_control": { "type": "ephemeral" }
}
]
},
{ "role": "user", "content": "用一句话回复:ok" }
]
}'
DeepSeek:默认磁盘前缀缓存
- •路径:POST https://api.lingfengtoken.com/v1/chat/completions
- •无需额外开关字段。把稳定的 system / 知识 / 工具说明放在 messages 最前,变化的用户问题放最后
- •后续请求的前缀须与已缓存前缀完全一致才会命中
- •回包:usage.prompt_cache_hit_tokens、usage.prompt_cache_miss_tokens(prompt_tokens 等于二者之和)
curl · DeepSeek 默认前缀缓存
curl -X POST "https://api.lingfengtoken.com/v1/chat/completions" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"max_tokens": 64,
"messages": [
{ "role": "system", "content": "REPLACE_WITH_LONG_STABLE_SYSTEM_PREFIX" },
{ "role": "user", "content": "用一句话回复:ok" }
]
}'
Kimi:默认自动前缀缓存
- •路径:POST https://api.lingfengtoken.com/v1/chat/completions
- •自动缓存;无需手动建 cache id;短前缀可能不入缓存
- •知识 / system / tools 定义保持稳定;多轮只追加、不改历史
- •可选 prompt_cache_key(会话亲和),不是开缓存开关
- •回包:看 usage 中与 cached / cache 相关字段
Google Gemini 文本模:文本对话走 Chat Completions。原厂另有 generateContent / cachedContents,本平台对文本模有路径限制,见下。
Gemini:Chat 路径看 cached_tokens;显式 cachedContents 未开放
- •文本主路径:POST https://api.lingfengtoken.com/v1/chat/completions(例如 gemini-3-flash-preview)
- •文本模请勿使用 /gemini/...:generateContent:该路径仅支持已开通的 Gemini 出图模型;出图另见场景表
- •请勿调用 /gemini/v1beta/cachedContents:本平台未开放显式 Context Cache
- •Chat 回包可见 usage.prompt_tokens_details.cached_tokens
- •亦可见 usage.completion_tokens_details.reasoning_tokens(思考消耗计量,不等于提示缓存命中)
- •稳定长前缀建议放在 messages 靠前;请按本说明字段接入,不要套用 Claude / GPT 显式断点
豆包 / 智谱 / Grok / MiniMax:是否开通以控制台模型权限为准;model 须与权限 ID 完全一致。
豆包 Seed:方舟上下文缓存
- •本平台文本主路径:POST https://api.lingfengtoken.com/v1/chat/completions
- •官方另有 Context API(context_id)与 Responses 侧 caching;本平台文本请先走 Chat Completions
- •Chat 侧请把稳定 system / 知识 / 工具说明放在 messages 最前,变化内容放最后
- •回包关注 usage 中 cached / cache 相关字段(随模型与实际回包)
curl · 豆包稳定前缀
curl -X POST "https://api.lingfengtoken.com/v1/chat/completions" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "doubao-seed-2-0-pro",
"max_tokens": 64,
"messages": [
{"role": "system", "content": "REPLACE_WITH_LONG_STABLE_SYSTEM_PREFIX"},
{"role": "user", "content": "用一句话回复:ok"}
]
}'
智谱 GLM:隐式上下文缓存
- •路径:POST https://api.lingfengtoken.com/v1/chat/completions
- •隐式缓存:无需开关字段。系统提示与历史前缀保持完全一致即可复用
- •回包:usage.prompt_tokens_details.cached_tokens
curl · 智谱隐式缓存
curl -X POST "https://api.lingfengtoken.com/v1/chat/completions" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2-cn",
"max_tokens": 64,
"messages": [
{"role": "system", "content": "REPLACE_WITH_LONG_STABLE_SYSTEM_PREFIX"},
{"role": "user", "content": "用一句话回复:ok"}
]
}'
xAI Grok:自动前缀缓存
- •路径:POST https://api.lingfengtoken.com/v1/chat/completions
- •官方自动缓存:连续请求共享相同消息前缀时可命中
- •多轮只追加、不改历史;推理模多轮须回传 reasoning_content(若有)
- •可选:请求体 prompt_cache_key,或请求头 x-grok-conv-id,用于提高命中稳定性(不是开缓存开关)
- •回包关注 usage 中 cached 相关字段
curl · Grok 前缀缓存
curl -X POST "https://api.lingfengtoken.com/v1/chat/completions" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.3",
"max_tokens": 64,
"prompt_cache_key": "demo-shared-prefix-v1",
"messages": [
{"role": "system", "content": "REPLACE_WITH_LONG_STABLE_SYSTEM_PREFIX"},
{"role": "user", "content": "用一句话回复:ok"}
]
}'
MiniMax:前缀复用
- •路径:POST https://api.lingfengtoken.com/v1/chat/completions
- •保持稳定长前缀;多轮完整回传 assistant(含思考相关字段),有利于前缀复用
- •回包关注 usage 中 cached 相关字段(随实际回包)
curl · MiniMax 前缀复用
curl -X POST "https://api.lingfengtoken.com/v1/chat/completions" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "MiniMax-M2.5",
"max_tokens": 64,
"messages": [
{"role": "system", "content": "REPLACE_WITH_LONG_STABLE_SYSTEM_PREFIX"},
{"role": "user", "content": "用一句话回复:ok"}
]
}'
缓存成功判定
| 族 | 写入字段 | 命中字段 |
|---|
| Claude | usage.cache_creation_input_tokens | usage.cache_read_input_tokens |
| GPT-5.6 Responses(显式) | usage.input_tokens_details.cache_write_tokens | usage.input_tokens_details.cached_tokens |
| 更早 GPT(自动) | 通常无独立 write 字段 | prompt_tokens_details 或 input_tokens_details 的 cached_tokens |
| 通义 Qwen | prompt_tokens_details.cache_creation_input_tokens(显式) | prompt_tokens_details.cached_tokens |
| DeepSeek | 无独立 write 字段(默认缓存) | usage.prompt_cache_hit_tokens(miss 见 prompt_cache_miss_tokens) |
| Kimi(原厂) | 通常无独立 write 字段 | usage 中 cached / cache 相关字段(随模型版本) |
| Gemini Chat | 无独立 write 字段(显式 cachedContents 未开放) | usage.prompt_tokens_details.cached_tokens |
| 豆包 Seed | 随实际回包(Chat 稳前缀;官方另有 Context/Responses) | usage 中 cached / cache 相关字段 |
| 智谱 GLM | 无独立 write 字段(隐式) | usage.prompt_tokens_details.cached_tokens |
| xAI Grok | 通常无独立 write 字段 | usage 中 cached 相关字段 |
| MiniMax | 通常无独立 write 字段 | usage 中 cached 相关字段 |
常见问题
- •评测或日志里的 prompt_cache_enabled 若来自客户端 meta,不是 EntHub AI 的「关缓存」开关。
- •GPT-5.6 提示缓存请走 Responses,观测 cache_write_tokens / cached_tokens。
- •Claude 提示缓存请走 Messages,观测 cache_creation_input_tokens / cache_read_input_tokens。
- •gpt-5.5 及更早模型不使用 prompt_cache_options / prompt_cache_breakpoint。
- •更早代际默认可自动缓存;prompt_cache_key / retention 为可选项,不是开缓存开关。
- •retention 取值须符合官方枚举(例如 gpt-5.5 仅 "24h";不要写成 in-memory 连字符)。
- •前缀任何字节变化(时间戳、随机 ID、JSON 键序)都会导致不命中。
- •通义、DeepSeek、Kimi、Gemini、豆包、智谱、Grok、MiniMax 请按下文对应品牌说明接入。
仓库示例脚本(需自备 Key):scripts/examples/prompt-cache-claude-messages.sh、scripts/examples/prompt-cache-gpt-responses.sh(环境变量 ENTHUB_API_KEY、可选 MODEL)。
推理与工具调用(协议选择)
涉及推理强度或函数/工具调用时,适用协议可能与「纯文本 Chat」不同。GPT-5.6 等模型在 Chat Completions 上携带 tools 时,常返回 400,需改用 Responses。下列按模型目录能力标签列出在售文本模,并给出推荐路径与最小示例。
能力列来自模型目录 category(Thinking / Function Calling)。是否对本企业开通,以控制台模型权限为准。
协议选择
| 场景 | 推荐路径 |
|---|
| 纯文本、无 tools、不调推理档 | 可用 POST /v1/chat/completions |
| GPT-5.6(luna/sol/terra)+ tools,或需 reasoning | 必须 POST /v1/responses |
| GPT-5.4/5.5 等:tools + reasoning_effort 非 none | 必须 POST /v1/responses |
| Codex / *-pro / o3-pro | 必须 POST /v1/responses(调用面本身无 Chat) |
| Claude 工具或扩展思考 | 必须 POST …/claude/v1/messages |
| 通义 / DeepSeek / Kimi 工具或思考 | POST /v1/chat/completions(见下文对应品牌说明) |
| Gemini 文本推理计量 / 工具 | 文本使用 Chat;原生 generateContent 仅出图模型 |
| 豆包 Seed 工具或思考 | POST /v1/chat/completions(见下文对应品牌说明) |
| 智谱 GLM 工具或思考 | POST /v1/chat/completions(thinking + tools) |
| Grok 工具或推理 | POST /v1/chat/completions(reasoning_effort + tools) |
| MiniMax 工具或思考 | POST /v1/chat/completions(M2.x 思考默认开;见下文对应品牌说明) |
- •OpenAI:推理模优先 Responses;自 GPT-5.4 起,Chat 上 tools 与非 none 的 reasoning_effort 不可同用。GPT-5.6 默认会推理,在 Chat 上携带 tools 时常直接返回 400,请改用 /v1/responses。
- •OpenAI Responses 工具形状与 Chat 不同:回包看 function_call;回传结果用 function_call_output(call_id),不要照搬 role=tool。
- •OpenAI 推理参数在 Responses 为 reasoning.effort / reasoning.mode(5.6 可选 pro);Chat 侧为 reasoning_effort(若仍走 Chat 且 effort=none 才可能带 tools)。
- •Anthropic Claude:工具与扩展思考均走 Messages(/claude/v1/messages);思考用 thinking;工具用 tools / tool_choice。
Claude
| 模型 ID | 推理 | 工具 | 推荐路径 | 说明 |
|---|
| claude-fable-5 | 是 | 是 | POST /claude/v1/messages | 目录标 Thinking/推理;目录标 Function Calling;工具用 Messages tools;扩展思考用 thinking 参数 |
| claude-haiku-4-5 | 是 | 是 | POST /claude/v1/messages | 目录标 Thinking/推理;目录标 Function Calling;工具用 Messages tools;扩展思考用 thinking 参数 |
| claude-opus-4-5 | 是 | 是 | POST /claude/v1/messages | 目录标 Thinking/推理;目录标 Function Calling;工具用 Messages tools;扩展思考用 thinking 参数 |
| claude-opus-4-6 | 是 | 是 | POST /claude/v1/messages | 目录标 Thinking/推理;目录标 Function Calling;工具用 Messages tools;扩展思考用 thinking 参数 |
| claude-opus-4-7 | 是 | 是 | POST /claude/v1/messages | 目录标 Thinking/推理;目录标 Function Calling;工具用 Messages tools;扩展思考用 thinking 参数 |
| claude-opus-4-8 | 否 | 是 | POST /claude/v1/messages | 目录未标 Thinking;目录标 Function Calling;工具用 Messages tools;扩展思考用 thinking 参数 |
| claude-sonnet-4-5 | 是 | 是 | POST /claude/v1/messages | 目录标 Thinking/推理;目录标 Function Calling;工具用 Messages tools;扩展思考用 thinking 参数 |
| claude-sonnet-4-6 | 是 | 是 | POST /claude/v1/messages | 目录标 Thinking/推理;目录标 Function Calling;工具用 Messages tools;扩展思考用 thinking 参数 |
| claude-sonnet-5 | 否 | 否 | POST /claude/v1/messages | 目录未标 Thinking;目录未标 Function Calling;工具用 Messages tools;扩展思考用 thinking 参数 |
GPT
| 模型 ID | 推理 | 工具 | 推荐路径 | 说明 |
|---|
| gpt-4.1 | 否 | 否 | Chat 或 Responses(纯文本可 Chat) | 目录未标 Thinking;目录未标 Function Calling |
| gpt-4.1-mini | 否 | 否 | Chat 或 Responses(纯文本可 Chat) | 目录未标 Thinking;目录未标 Function Calling |
| gpt-4.1-nano | 否 | 否 | Chat 或 Responses(纯文本可 Chat) | 目录未标 Thinking;目录未标 Function Calling |
| gpt-5 | 是 | 是 | 推理或工具:必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;tools + 非 none 推理须 Responses |
| gpt-5-codex | 是 | 是 | 必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;调用面无 Chat 通道 |
| gpt-5-mini | 是 | 是 | 推理或工具:必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;tools + 非 none 推理须 Responses |
| gpt-5-nano | 是 | 是 | 推理或工具:必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;tools + 非 none 推理须 Responses |
| gpt-5-pro | 是 | 是 | 必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;调用面无 Chat 通道 |
| gpt-5.1 | 是 | 是 | 推理或工具:必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;tools + 非 none 推理须 Responses |
| gpt-5.1-codex | 是 | 是 | 必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;调用面无 Chat 通道 |
| gpt-5.1-codex-max | 是 | 是 | 必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;调用面无 Chat 通道 |
| gpt-5.1-codex-mini | 是 | 是 | 必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;调用面无 Chat 通道 |
| gpt-5.2 | 是 | 否 | Chat 或 Responses(纯文本可 Chat) | 目录标 Thinking/推理;目录未标 Function Calling |
| gpt-5.2-chat | 否 | 否 | Chat 或 Responses(纯文本可 Chat) | 目录未标 Thinking;目录未标 Function Calling |
| gpt-5.2-codex | 是 | 是 | 必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;调用面无 Chat 通道 |
| gpt-5.3-codex | 是 | 是 | 必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;调用面无 Chat 通道 |
| gpt-5.4 | 是 | 是 | 推理或工具:必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;tools + 非 none 推理须 Responses |
| gpt-5.4-mini | 是 | 是 | 推理或工具:必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;tools + 非 none 推理须 Responses |
| gpt-5.4-nano | 是 | 是 | 推理或工具:必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;tools + 非 none 推理须 Responses |
| gpt-5.4-pro | 是 | 是 | 必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;调用面无 Chat 通道 |
| gpt-5.5 | 是 | 是 | 推理或工具:必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;tools + 非 none 推理须 Responses |
| gpt-5.6-luna | 是 | 是 | 推理或工具:必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;5.6 默认推理;tools 打 Chat 易 400 |
| gpt-5.6-sol | 是 | 是 | 推理或工具:必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;5.6 默认推理;tools 打 Chat 易 400 |
| gpt-5.6-terra | 是 | 是 | 推理或工具:必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;5.6 默认推理;tools 打 Chat 易 400 |
| gpt-chat-latest | 否 | 是 | Chat 或 Responses(纯文本可 Chat) | 目录未标 Thinking;目录标 Function Calling |
OpenAI o 系列
| 模型 ID | 推理 | 工具 | 推荐路径 | 说明 |
|---|
| o3 | 是 | 是 | 推理或工具:必须 POST /v1/responses | 目录标 Thinking/推理;目录标 Function Calling;tools + 非 none 推理须 Responses |
| o3-mini | 是 | 否 | 推理或工具:必须 POST /v1/responses | 目录标 Thinking/推理;目录未标 Function Calling;tools + 非 none 推理须 Responses |
| o3-pro | 是 | 否 | 必须 POST /v1/responses | 目录标 Thinking/推理;目录未标 Function Calling;调用面无 Chat 通道 |
| o4-mini | 是 | 否 | 推理或工具:必须 POST /v1/responses | 目录标 Thinking/推理;目录未标 Function Calling;tools + 非 none 推理须 Responses |
通义 / DeepSeek / Kimi:是否开通以控制台模型权限为准;model 须与权限 ID 完全一致。
通义 Qwen
| 模型 ID | 推理 | 工具 | 推荐路径 | 说明 |
|---|
| qwen-vl-max | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3-max | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3-max-2026-01-23-glb | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3-max-cn | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3-vl-flash-cn | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3-vl-plus | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3-vl-plus-2025-12-19-glb | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3-vl-plus-cn | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3.5-flash | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3.5-flash-cn | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3.5-flash-glb | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3.5-plus | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3.5-plus-cn | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3.5-plus-glb | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3.6-flash-cn | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3.6-flash-glb | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3.6-max-preview-cn | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3.6-max-preview-glb | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3.6-plus | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3.6-plus-cn | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3.6-plus-glb | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3.7-max-cn | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3.7-max-glb | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| qwen3.8-max | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
- •qwen3.8-max 等混合思考模型默认开启思考。HTTP 请求体使用顶层 enable_thinking;OpenAI Python SDK 放在 extra_body。简单问答可设 false。
- •思考内容在 reasoning_content。可用 thinking_budget 限制思考过程的最大 token 数。思考开启时 max_tokens 取值范围为 1–32768;限制「思考 + 回复」总长度时可用 max_completion_tokens。
- •多轮如需模型读取历史思考过程,加 preserve_thinking: true,并把历史 assistant 的 reasoning_content 原样回传,不要拼进 content。
- •工具调用使用 OpenAI 兼容 tools / tool_calls。应用端执行后再把 role=tool 的结果追加回 messages。
curl · 通义思考模式
curl -X POST "https://api.lingfengtoken.com/v1/chat/completions" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"max_tokens": 256,
"enable_thinking": true,
"stream": true,
"messages": [{"role": "user", "content": "用三步说明如何做代码评审"}]
}'
curl · 通义工具调用
curl -X POST "https://api.lingfengtoken.com/v1/chat/completions" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"max_tokens": 256,
"messages": [
{"role": "user", "content": "上海天气如何?若需要请调用工具。"}
],
"tools": [
{
"type": "function",
"function": {
"name": "get_weather",
"description": "按城市查询天气",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"]
}
}
}
]
}'
DeepSeek
| 模型 ID | 推理 | 工具 | 推荐路径 | 说明 |
|---|
| deepseek-r1 | 是 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| deepseek-v3.1 | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| deepseek-v3.1-cn | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| deepseek-v3.2 | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| deepseek-v3.2-cn | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| deepseek-v4-flash | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| deepseek-v4-pro-cn | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
- •用 thinking.type 开关思考(enabled / disabled,默认 enabled),用 reasoning_effort 调节力度(low / high / max,默认 high)。关闭思考也可设 reasoning_effort: none。
- •思考内容在 message.reasoning_content,最终回复在 message.content。OpenAI Python SDK 中 thinking 放在 extra_body。
- •工具使用 OpenAI 兼容 tools / tool_calls。思考模式下若请求带了 tools,后续每一轮都必须把 assistant 的 reasoning_content 原样回传。tool_choice 为 required 或指定某个函数时,需先关闭思考。
curl · DeepSeek 思考模式
curl -X POST "https://api.lingfengtoken.com/v1/chat/completions" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"max_tokens": 256,
"thinking": {"type": "enabled"},
"reasoning_effort": "high",
"messages": [{"role": "user", "content": "逐步计算 17*19,只给最终数"}]
}'
curl · DeepSeek 工具调用
curl -X POST "https://api.lingfengtoken.com/v1/chat/completions" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"max_tokens": 256,
"thinking": {"type": "disabled"},
"messages": [
{"role": "user", "content": "现在几点?若需要请调用工具。"}
],
"tools": [
{
"type": "function",
"function": {
"name": "get_time",
"description": "获取当前时间",
"parameters": {"type": "object", "properties": {}}
}
}
]
}'
Kimi
| 模型 ID | 推理 | 工具 | 推荐路径 | 说明 |
|---|
| kimi-k2-thinking | 是 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| kimi-k2.5 | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| kimi-k2.5-cn | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| kimi-k2.6-cn | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| kimi-k2.7-code-cn | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| kimi-k3 | 是 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
- •K3 等思考模常默认开启思考;可用顶层 reasoning_effort(如 low/high/max)调节。
- •工具环必须把完整 assistant 消息(含 reasoning_content 与 tool_calls)追加回 messages,只留 content 会断链。
curl · Kimi tools
curl -X POST "https://api.lingfengtoken.com/v1/chat/completions" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k2.6-cn",
"max_tokens": 256,
"messages": [
{ "role": "user", "content": "现在几点?若需要请调用工具。" }
],
"tools": [
{
"type": "function",
"function": {
"name": "get_time",
"description": "获取当前时间",
"parameters": { "type": "object", "properties": {} }
}
}
]
}'
Gemini:推理计量与工具
- •Chat 成功回包可含 completion_tokens_details.reasoning_tokens——表示推理 token 计量,不是原厂 thinkingConfig 原生块。
- •原生 generateContent + thinkingConfig / functionDeclarations:文本模请走 Chat;出图模型才走 /gemini 原生路径。
- •Chat + tools:使用 OpenAI 兼容 tools;以实际回包为准。
- •个别 ID 可能因算力区域限制返回 403,与协议字段无关。
豆包 / 智谱 / Grok / MiniMax:是否开通以控制台模型权限为准;model 须与权限 ID 完全一致。
豆包 Seed
| 模型 ID | 推理 | 工具 | 推荐路径 | 说明 |
|---|
| doubao-seed-2-0-code | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| doubao-seed-2-0-code-preview-260215 | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| doubao-seed-2-0-lite | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| doubao-seed-2-0-lite-260215 | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| doubao-seed-2-0-mini | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| doubao-seed-2-0-mini-260215 | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| doubao-seed-2-0-pro | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| doubao-seed-2-0-pro-260215 | 是 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| seed-2-0-lite | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| seed-2-0-mini | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| seed-2-0-pro | 是 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
- •工具调用使用 OpenAI 兼容 tools / tool_calls;应用端执行后以 role=tool 回传。
- •目录标 Thinking 的 Seed 文本模可按官方思考字段接入;以实际回包为准。
curl · 豆包工具调用
curl -X POST "https://api.lingfengtoken.com/v1/chat/completions" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "doubao-seed-2-0-pro",
"max_tokens": 256,
"messages": [{"role": "user", "content": "上海天气如何?若需要请调用工具。"}],
"tools": [{
"type": "function",
"function": {
"name": "get_weather",
"description": "按城市查询天气",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"]
}
}
}]
}'
智谱 GLM
| 模型 ID | 推理 | 工具 | 推荐路径 | 说明 |
|---|
| glm-4.6 | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| glm-4.7 | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| glm-5 | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| glm-5-cn | 否 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| glm-5.1-cn | 否 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| glm-5.2-cn | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| glm-5.2-glb | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| glm-5.3-cn | 否 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
- •GLM-5 / 4.7 等系列默认开启思考。请求体 thinking.type = enabled / disabled;OpenAI Python SDK 放在 extra_body。
- •思考内容在 reasoning_content。工具环请把完整 assistant(含 reasoning_content 与 tool_calls)回传。
- •编码/Agent 场景可用 clear_thinking: false 保留历史思考,并原样回传 reasoning_content。
- •工具使用 OpenAI 兼容 tools。
curl · 智谱思考
curl -X POST "https://api.lingfengtoken.com/v1/chat/completions" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2-cn",
"max_tokens": 256,
"thinking": {"type": "enabled"},
"messages": [{"role": "user", "content": "用三步说明如何做代码评审"}]
}'
curl · 智谱工具
curl -X POST "https://api.lingfengtoken.com/v1/chat/completions" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2-cn",
"max_tokens": 256,
"thinking": {"type": "enabled"},
"messages": [{"role": "user", "content": "北京天气如何?若需要请调用工具。"}],
"tools": [{
"type": "function",
"function": {
"name": "get_weather",
"description": "按城市查询天气",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"]
}
}
}]
}'
xAI Grok
| 模型 ID | 推理 | 工具 | 推荐路径 | 说明 |
|---|
| grok-4-1-fast-non-reasoning | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| grok-4-1-fast-reasoning | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| grok-4-20-non-reasoning | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| grok-4-20-reasoning | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| grok-4.3 | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
- •推理模可用 reasoning_effort(如 low / medium / high;部分模支持 none)。
- •工具使用 OpenAI 兼容 tools / tool_calls。
- •多轮勿改历史;若回包含 reasoning_content,请原样回传以保持连贯与缓存命中。
curl · Grok 工具
curl -X POST "https://api.lingfengtoken.com/v1/chat/completions" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.3",
"max_tokens": 256,
"reasoning_effort": "low",
"messages": [{"role": "user", "content": "现在几点?若需要请调用工具。"}],
"tools": [{
"type": "function",
"function": {
"name": "get_time",
"description": "获取当前时间",
"parameters": {"type": "object", "properties": {}}
}
}]
}'
MiniMax
| 模型 ID | 推理 | 工具 | 推荐路径 | 说明 |
|---|
| MiniMax-M2.5 | 是 | 否 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
| MiniMax-M2.5-cn | 是 | 是 | POST /v1/chat/completions | 见下文提示缓存与推理说明 |
- •MiniMax-M2.x(含 M2.5)思考默认开启且官方说明不可关闭。
- •可用 reasoning_split: true(extra_body)将思考拆到 reasoning_content / reasoning_details;该字段只改返回形态,不开关思考。
- •工具使用 OpenAI 兼容 tools。多轮必须完整回传 assistant(含 tool_calls 与思考相关字段)。
curl · MiniMax 思考拆分
curl -X POST "https://api.lingfengtoken.com/v1/chat/completions" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "MiniMax-M2.5",
"max_tokens": 256,
"reasoning_split": true,
"messages": [{"role": "user", "content": "用三步说明如何做代码评审"}]
}'
curl · MiniMax 工具
curl -X POST "https://api.lingfengtoken.com/v1/chat/completions" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "MiniMax-M2.5",
"max_tokens": 256,
"reasoning_split": true,
"messages": [{"role": "user", "content": "上海天气如何?若需要请调用工具。"}],
"tools": [{
"type": "function",
"function": {
"name": "get_weather",
"description": "按城市查询天气",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"]
}
}
}]
}'
示例:GPT 推理(Responses)
curl · reasoning
curl -X POST "https://api.lingfengtoken.com/v1/responses" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.6-sol",
"input": "用三句话解释什么是提示缓存",
"max_output_tokens": 256,
"reasoning": { "effort": "low" }
}'
示例:GPT 工具调用(Responses)
curl · function tools
curl -X POST "https://api.lingfengtoken.com/v1/responses" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.6-sol",
"input": "上海现在天气怎么样?",
"tools": [
{
"type": "function",
"name": "get_weather",
"description": "按城市查询天气",
"parameters": {
"type": "object",
"properties": { "city": { "type": "string" } },
"required": ["city"],
"additionalProperties": false
},
"strict": true
}
],
"reasoning": { "effort": "low" }
}'
若 Responses 回包出现 type=function_call:本地执行后,用 type=function_call_output 且同一 call_id 回传;推理模建议带回 reasoning 项或使用 previous_response_id。不要把 Chat 的 role=tool 原样丢进 Responses。
示例:Claude 工具调用(Messages)
curl · Claude tools
curl -X POST "https://lingfengtoken.com/api/claude/v1/messages" \
-H "Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx" \
-H "Content-Type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-sonnet-4-6",
"max_tokens": 512,
"tools": [
{
"name": "get_weather",
"description": "按城市查询天气",
"input_schema": {
"type": "object",
"properties": { "city": { "type": "string" } },
"required": ["city"]
}
}
],
"messages": [
{ "role": "user", "content": "上海天气如何?" }
]
}'
附录:地址一览
| 用途 | Base URL |
|---|
| OpenAI 兼容(推荐) | https://api.lingfengtoken.com/v1 |
| OpenAI 兼容(等价) | https://lingfengtoken.com/api/v1 |
| 豆包 / 通义 / Gemini 前缀 | https://lingfengtoken.com/api |
鉴权(唯一):
Authorization: Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx默认使用 Bearer sk-lf-。Claude Code 通过 x-api-key 发送 sk-lf- 时,/claude 路径已支持。Gemini 原生请用 Bearer,勿用 x-goog-api-key。
多语言 Chat 示例
Python
import requests
resp = requests.post(
"https://api.lingfengtoken.com/v1/chat/completions",
headers={
"Authorization": "Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx",
"Content-Type": "application/json",
},
json={
"model": "gpt-4o-mini",
"messages": [{"role": "user", "content": "你好"}],
},
timeout=60,
)
print(resp.status_code, resp.json())
Node.js
const res = await fetch("https://api.lingfengtoken.com/v1/chat/completions", {
method: "POST",
headers: {
Authorization: "Bearer sk-lf-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx",
"Content-Type": "application/json",
},
body: JSON.stringify({
model: "gpt-4o-mini",
messages: [{ role: "user", content: "你好" }],
}),
});
console.log(await res.json());