Base URL 与令牌
把 OpenAI SDK 的 base_url 换成大碗接入地址,api_key 用控制台生成的 sk- 令牌,其余代码不变。
接入参数
Base URL: https://aidelay.moelingbuddy.com/v1
API Key: sk-**** # 控制台 → 令牌 → 新建
模型名: kimi-k3 # 见定价页,统一模型名
令牌支持设置额度、RPM / TPM 限流、过期时间与 IP 白名单,建议按应用粒度拆分令牌。
多语言示例
Python · openai SDK
from openai import OpenAI
client = OpenAI(
base_url="https://aidelay.moelingbuddy.com/v1",
api_key="sk-你的大碗令牌",
)
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "用一句话介绍你自己"}],
)
print(resp.choices[0].message.content)
print(resp.usage) # prompt / completion / total tokens
Node.js · openai SDK
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://aidelay.moelingbuddy.com/v1",
apiKey: "sk-你的大碗令牌",
});
const resp = await client.chat.completions.create({
model: "kimi-k3",
messages: [{ role: "user", content: "用一句话介绍你自己" }],
});
console.log(resp.choices[0].message.content);
cURL
curl https://aidelay.moelingbuddy.com/v1/chat/completions \
-H "Authorization: Bearer sk-你的大碗令牌" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "用一句话介绍你自己"}]
}'
模型与上下文窗
对客户暴露统一模型名,上游更换不影响你侧配置。当前可用模型与倍率见定价页(实时同步后台)。
限流(RPM / TPM)
- 每个令牌独立 RPM(每分钟请求数) 与 TPM(每分钟 token 数) 限额,控制台可自助调整;
- 超限返回标准 429 与明确 message,请做指数退避重试;
- 需要更高配额请联系我们(关于页「联系我们」)。
流式与 usage
请求体加 "stream": true 即为 SSE 流式,分片实时下发;最后一个分片为 data: [DONE]。非流式与流式的最后一帧都带 usage(prompt / completion / total tokens)。
流式分片示例
data: {"choices":[{"delta":{"content":"你"}}]}
data: {"choices":[{"delta":{"content":"好"}}]}
data: [DONE]
错误码
| 状态码 | 含义 | 处理建议 |
|---|---|---|
| 401 | 令牌无效或已过期 | 控制台检查令牌状态 |
| 403 | 令牌无该模型权限 / IP 不在白名单 | 检查令牌分组与白名单设置 |
| 404 | 模型名不存在或路径错误 | 核对模型名与 Base URL |
| 429 | 触发限流或上游配额到顶 | 指数退避重试;持续出现联系我们调额 |
| 5xx | 上游或网关异常 | 自动重试其他渠道;持续出现看状态页 |
Codex(Responses API)
Codex CLI 与新版 OpenAI SDK 默认走 /v1/responses 端点,大碗已跟进支持;个别渠道的兼容细节仍在快速修复,建议始终使用最新接入公告中的推荐配置。
部署后会在状态页与本文同步该端点的可用性。
Claude / Gemini
- Claude:/v1/messages 原生格式可接,网关自动互转;
- Gemini:Gemini 原生格式可接;
- 三者计费口径一致:token 用量 × 模型倍率。