文档中心
官网首页
官网首页
  1. 开始使用
  • 开始使用
    • 产品简介
    • 快速入门
    • 在 AI 编程工具中使用 Nexhina
  • API 接口
    • 接口调用说明
      • 快速开始
      • 获取 API Key
      • 鉴权方式
      • 请求地址
      • 错误码说明
      • 流式输出说明
    • Chat
      • 对话补全
    • Models
      • 列出可用模型
    • Responses
      • Responses API
    • Embeddings
      • 文本向量化
    • Images
      • 生成图像
    • Audio
      • 文本转语音(TTS)
      • 语音转文本(STT)
      • 语音翻译
    • Video
      • 火山
        • 创建视频任务
        • 查询视频任务
      • 素材管理
        • 创建素材组
        • 创建素材
        • 查询素材组列表
        • 查询素材组
        • 查询素材列表
        • 查询单个素材
        • 更新素材组
        • 更新素材
        • 删除素材
        • 删除素材组
      • 生成视频
    • Moderation
      • 内容审核
    • Rerank
      • 重排序
  • 平台相关
    • 常见问题
    • 平台协议
    • 隐私政策
  1. 开始使用

快速入门

1. 模型列表与选择指南#

查询可用模型#

返回结果中 data[].id 就是可用的 model 参数值。

Chat 模型(2026 主流)#

模型上下文特点适用场景
deepseek-v4-pro1M深度求索旗舰,Agent / 推理强,可切换思考强度复杂 Agent、工程任务、深度推理
deepseek-v4-flash1M更快更便宜,性价比极高高并发、日常对话、轻量任务
kimi-k31M月之暗面旗舰,2.8T 参数,原生多模态长文档、编程 Agent、知识工作
glm-5.21M智谱旗舰,编程与长程 Agent 突出代码工程、端到端开发、工具调用
qwen3.8-max1M通义千问旗舰,2.4T 参数,办公/科研强复杂任务、办公自动化、科研复现
qwen-plus128K+通义均衡版,性价比高通用中文任务
qwen-turbo128K速度快、成本低高并发、简单对话
doubao-pro128K+豆包专业版多轮对话、内容生成
doubao-lite32K+豆包轻量版高并发、简单场景
ernie-5.0200K文心一言旗舰中文创作、知识问答
hunyuan-pro32K+腾讯混元企业场景、中文业务
abab6.5s200KMiniMax,长上下文长文档、角色扮演
选型建议
要最强综合 / Agent:优先 deepseek-v4-pro、kimi-k3、glm-5.2、qwen3.8-max
要性价比 / 高并发:优先 deepseek-v4-flash、qwen-turbo、doubao-lite
偏编程工程:优先 glm-5.2、deepseek-v4-pro、kimi-k3
偏长文档 / 办公:优先 kimi-k3、qwen3.8-max

Embedding 模型#

模型维度说明
text-embedding-v31024(可降维)通义向量,推荐生产使用
text-embedding-v21536通义通用版
embedding-32048智谱向量,中文语义强
bge-large-zh1024BGE 中文,开源生态友好

图像模型#

模型说明
wanx-v1通义万相,文生图 / 图生图
jimeng-2.1即梦,创意与风格强
hunyuan-image腾讯混元生图
kolors快手可图
cogview-3智谱生图

语音模型#

模型用途说明
cosyvoice-v1文本转语音通义,自然度高
qwen-tts文本转语音支持风格控制
speech-01文本转语音MiniMax
paraformer-v2语音转文本达摩院,中文识别强
fun-asr语音转文本 / 翻译多场景 ASR

视频模型#

对,视频这块应以 Seedance 2.0 / 2.5 为主。按当前国内主流改一版:

视频模型#

模型说明
seedance-2.0字节 Seedance 2.0,文生/图生视频,多模态参考,原生音频,最长约 15 秒
seedance-2.0-fastSeedance 2.0 快速版,成本更低、出片更快
seedance-2.5Seedance 2.5,单次最长约 30 秒,参考素材更多,偏长叙事
kling-v3快手可灵 3.0,动作与物理真实感强,适合剧情/短剧
kling-v2可灵 2.x,性价比与稳定性好
vidu-q3生数 Vidu,主体一致性强,适合漫剧 / IP
hailuo-videoMiniMax 海螺,中文理解好,上手快
wan-video通义万相视频,阿里云生态友好
cogvideox智谱清影
选型参考:
综合画质 / 多模态 / 工业创作 → Seedance 2.0 / 2.5
复杂动作、物理真实 → 可灵 Kling
角色一致性、漫剧短剧 → Vidu
成本与速度 → Seedance Fast / 可灵

Rerank 模型#

模型说明
gte-rerank通义 GTE 重排,RAG 推荐
bge-reranker-v2BGE 重排,中文检索优化

Moderation 模型#

模型说明
qwen-moderation通义内容安全
text-moderation通用文本审核
提示:实际可用模型以 GET /v1/models 返回为准,平台会持续更新。

2. 额度与计费说明#

计费方式#

按 Token 用量 计费,不同模型价格不同。
输入 Token(prompt_tokens):发给模型的内容
输出 Token(completion_tokens):模型生成的内容
一般输出 Token 单价高于输入 Token

Token 粗略换算#

语言1 Token ≈
英文4 个字符 / 0.75 个单词
中文1~2 个汉字

模型倍率(示意,以 qwen-turbo = 1x 为基准)#

模型输入倍率输出倍率说明
qwen-turbo1x1x基准
deepseek-v4-flash0.5x~1x0.5x~1x高性价比
qwen-plus2x6x均衡
deepseek-v4-pro3x~5x8x~15x旗舰
glm-5.24x~6x12x~20x编程 / Agent 强
kimi-k35x~8x15x~25x超大参数 / 长上下文
qwen3.8-max5x~10x15x~30x通义旗舰
倍率仅供参考,以运营后台 模型价格 配置为准。

额度查询#

管理后台 → 令牌管理:查看 Key 已用 / 剩余额度
接口响应中的 usage 字段:本次消耗

额度耗尽#

{
  "error": {
    "message": "Insufficient quota",
    "type": "insufficient_quota",
    "code": "insufficient_quota"
  }
}
HTTP 状态码:402。需充值或更换有额度的 Key。

各接口计费依据#

接口计费依据
Chat / Responses输入 + 输出 Token
Embeddings输入 Token
Images按张数和模型
Audio TTS按输入字符数
Audio STT / Translation按音频时长
Video按次
Moderation输入 Token(通常很少)
Rerank输入 Token

3. 速率限制说明#

限制维度#

维度含义
RPM每分钟请求数
TPM每分钟 Token 数
按 API Key 独立计算
管理员可为不同令牌组设置不同限额
默认值因部署而异,以管理员配置为准

超限响应#

{
  "error": {
    "message": "Rate limit reached for default",
    "type": "rate_limit_error",
    "code": "rate_limit_exceeded"
  }
}
HTTP 状态码:429。

相关响应头#

Header含义
X-RateLimit-Limit当前周期总限额
X-RateLimit-Remaining当前周期剩余次数
X-RateLimit-Reset限额重置时间(Unix 时间戳)

应对策略#

1.
读响应头,提前看 X-RateLimit-Remaining
2.
客户端本地限流,不要等 429
3.
收到 429 后指数退避:1s → 2s → 4s → 8s
4.
多 Key 轮换提高总吞吐
5.
精简 prompt,减少无效 Token

Embedding 批量调用示例#

降维示例#

降维会损失精度,建议从高维试起,再按效果下调。

Rerank 参数建议#

参数建议
model默认 gte-rerank
top_n一般 3~5
return_documents建议 true,避免再按索引查原文

当前国产第一梯队(简要)#

厂商旗舰型号大致定位
深度求索DeepSeek-V4-Pro / Flash推理 + Agent,性价比标杆
月之暗面Kimi K3超大参数、长上下文、多模态
智谱GLM-5.2编程与长程 Agent
阿里Qwen3.8-Max综合旗舰、办公 / 科研
字节Doubao Pro/Lite高并发与通用对话
百度Ernie 5.0中文知识与创作
若你平台上的 model id 与上表不完全一致,以 GET /v1/models 返回的 id 为准即可。
上一页
产品简介
下一页
在 AI 编程工具中使用 Nexhina