data[].id 就是可用的 model 参数值。| 模型 | 上下文 | 特点 | 适用场景 |
|---|---|---|---|
deepseek-v4-pro | 1M | 深度求索旗舰,Agent / 推理强,可切换思考强度 | 复杂 Agent、工程任务、深度推理 |
deepseek-v4-flash | 1M | 更快更便宜,性价比极高 | 高并发、日常对话、轻量任务 |
kimi-k3 | 1M | 月之暗面旗舰,2.8T 参数,原生多模态 | 长文档、编程 Agent、知识工作 |
glm-5.2 | 1M | 智谱旗舰,编程与长程 Agent 突出 | 代码工程、端到端开发、工具调用 |
qwen3.8-max | 1M | 通义千问旗舰,2.4T 参数,办公/科研强 | 复杂任务、办公自动化、科研复现 |
qwen-plus | 128K+ | 通义均衡版,性价比高 | 通用中文任务 |
qwen-turbo | 128K | 速度快、成本低 | 高并发、简单对话 |
doubao-pro | 128K+ | 豆包专业版 | 多轮对话、内容生成 |
doubao-lite | 32K+ | 豆包轻量版 | 高并发、简单场景 |
ernie-5.0 | 200K | 文心一言旗舰 | 中文创作、知识问答 |
hunyuan-pro | 32K+ | 腾讯混元 | 企业场景、中文业务 |
abab6.5s | 200K | MiniMax,长上下文 | 长文档、角色扮演 |
选型建议 要最强综合 / Agent:优先 deepseek-v4-pro、kimi-k3、glm-5.2、qwen3.8-max要性价比 / 高并发:优先 deepseek-v4-flash、qwen-turbo、doubao-lite偏编程工程:优先 glm-5.2、deepseek-v4-pro、kimi-k3偏长文档 / 办公:优先 kimi-k3、qwen3.8-max
| 模型 | 维度 | 说明 |
|---|---|---|
text-embedding-v3 | 1024(可降维) | 通义向量,推荐生产使用 |
text-embedding-v2 | 1536 | 通义通用版 |
embedding-3 | 2048 | 智谱向量,中文语义强 |
bge-large-zh | 1024 | BGE 中文,开源生态友好 |
| 模型 | 说明 |
|---|---|
wanx-v1 | 通义万相,文生图 / 图生图 |
jimeng-2.1 | 即梦,创意与风格强 |
hunyuan-image | 腾讯混元生图 |
kolors | 快手可图 |
cogview-3 | 智谱生图 |
| 模型 | 用途 | 说明 |
|---|---|---|
cosyvoice-v1 | 文本转语音 | 通义,自然度高 |
qwen-tts | 文本转语音 | 支持风格控制 |
speech-01 | 文本转语音 | MiniMax |
paraformer-v2 | 语音转文本 | 达摩院,中文识别强 |
fun-asr | 语音转文本 / 翻译 | 多场景 ASR |
| 模型 | 说明 |
|---|---|
seedance-2.0 | 字节 Seedance 2.0,文生/图生视频,多模态参考,原生音频,最长约 15 秒 |
seedance-2.0-fast | Seedance 2.0 快速版,成本更低、出片更快 |
seedance-2.5 | Seedance 2.5,单次最长约 30 秒,参考素材更多,偏长叙事 |
kling-v3 | 快手可灵 3.0,动作与物理真实感强,适合剧情/短剧 |
kling-v2 | 可灵 2.x,性价比与稳定性好 |
vidu-q3 | 生数 Vidu,主体一致性强,适合漫剧 / IP |
hailuo-video | MiniMax 海螺,中文理解好,上手快 |
wan-video | 通义万相视频,阿里云生态友好 |
cogvideox | 智谱清影 |
选型参考: 综合画质 / 多模态 / 工业创作 → Seedance 2.0 / 2.5 复杂动作、物理真实 → 可灵 Kling 角色一致性、漫剧短剧 → Vidu 成本与速度 → Seedance Fast / 可灵
| 模型 | 说明 |
|---|---|
gte-rerank | 通义 GTE 重排,RAG 推荐 |
bge-reranker-v2 | BGE 重排,中文检索优化 |
| 模型 | 说明 |
|---|---|
qwen-moderation | 通义内容安全 |
text-moderation | 通用文本审核 |
提示:实际可用模型以 GET /v1/models返回为准,平台会持续更新。
| 语言 | 1 Token ≈ |
|---|---|
| 英文 | 4 个字符 / 0.75 个单词 |
| 中文 | 1~2 个汉字 |
qwen-turbo = 1x 为基准)| 模型 | 输入倍率 | 输出倍率 | 说明 |
|---|---|---|---|
| qwen-turbo | 1x | 1x | 基准 |
| deepseek-v4-flash | 0.5x~1x | 0.5x~1x | 高性价比 |
| qwen-plus | 2x | 6x | 均衡 |
| deepseek-v4-pro | 3x~5x | 8x~15x | 旗舰 |
| glm-5.2 | 4x~6x | 12x~20x | 编程 / Agent 强 |
| kimi-k3 | 5x~8x | 15x~25x | 超大参数 / 长上下文 |
| qwen3.8-max | 5x~10x | 15x~30x | 通义旗舰 |
倍率仅供参考,以运营后台 模型价格 配置为准。
usage 字段:本次消耗{
"error": {
"message": "Insufficient quota",
"type": "insufficient_quota",
"code": "insufficient_quota"
}
}402。需充值或更换有额度的 Key。| 接口 | 计费依据 |
|---|---|
| Chat / Responses | 输入 + 输出 Token |
| Embeddings | 输入 Token |
| Images | 按张数和模型 |
| Audio TTS | 按输入字符数 |
| Audio STT / Translation | 按音频时长 |
| Video | 按次 |
| Moderation | 输入 Token(通常很少) |
| Rerank | 输入 Token |
| 维度 | 含义 |
|---|---|
| RPM | 每分钟请求数 |
| TPM | 每分钟 Token 数 |
{
"error": {
"message": "Rate limit reached for default",
"type": "rate_limit_error",
"code": "rate_limit_exceeded"
}
}429。| Header | 含义 |
|---|---|
X-RateLimit-Limit | 当前周期总限额 |
X-RateLimit-Remaining | 当前周期剩余次数 |
X-RateLimit-Reset | 限额重置时间(Unix 时间戳) |
X-RateLimit-Remaining降维会损失精度,建议从高维试起,再按效果下调。
| 参数 | 建议 |
|---|---|
model | 默认 gte-rerank |
top_n | 一般 3~5 |
return_documents | 建议 true,避免再按索引查原文 |
| 厂商 | 旗舰型号 | 大致定位 |
|---|---|---|
| 深度求索 | DeepSeek-V4-Pro / Flash | 推理 + Agent,性价比标杆 |
| 月之暗面 | Kimi K3 | 超大参数、长上下文、多模态 |
| 智谱 | GLM-5.2 | 编程与长程 Agent |
| 阿里 | Qwen3.8-Max | 综合旗舰、办公 / 科研 |
| 字节 | Doubao Pro/Lite | 高并发与通用对话 |
| 百度 | Ernie 5.0 | 中文知识与创作 |
GET /v1/models 返回的 id 为准即可。