实时监控 · 每 2 秒刷新 · 滚动窗口约 4 分钟
采样中…模型输出吞吐
–请求速率
–网关实测 · 次/分
GPU 使用率
–GPU 温度 / 显存
–CPU 使用率
–CPU 温度
–主板 ACPI 热敏区(需管理员权限启动网关才可读取)
内存使用率
–今日请求
0
累计 0 次
今日 Token
0
累计 0
今日错误
0
4xx / 5xx / 499
启用中的 Key
0
网关运行 —
今日逐小时请求量
近 14 天 Token 用量
最近 10 次调用
| 时间 | Key | 端点 | 状态 | Token | 耗时 |
|---|
接入信息(其他电脑用这个)
Base URL(局域网)
http://192.168.10.70:8787/v1
Base URL(公网 HTTPS)
(隧道未运行)
Base URL(本机)
http://127.0.0.1:8787/v1模型名(model 参数)
qwen3.8-flash-next-iq3_s
鉴权 Header
Authorization: Bearer *** 网关发的 sk-... Key》备选鉴权 Header
x-api-key: <Key>上下文长度
65,536 tokens(输入+输出共享)
协议
OpenAI Chat / OpenAI Responses / Anthropic Messages,均支持流式与工具调用
任何"OpenAI 兼容"客户端(Open WebUI、Cherry Studio、LobeChat、openai SDK 等)填上面 Base URL + Key 即可。Key 在「API Key 管理」页创建。
局域网外的用户用「Base URL(公网 HTTPS)」那一行的地址(后面同样接
局域网外的用户用「Base URL(公网 HTTPS)」那一行的地址(后面同样接
/v1);该地址由 Cloudflare 隧道生成,隧道或电脑重启后会变,变了要重新告知用户。下方示例里的地址按需替换成公网地址。网关开放的端点
| 方法 | 端点 | 说明 |
|---|---|---|
| POST | /v1/chat/completions | 聊天补全(最常用,流式/非流式、tools、JSON 模式) |
| POST | /v1/responses | OpenAI Responses API(Codex CLI 等) |
| POST | /v1/messages | Anthropic Messages(Claude Code 等) |
| GET | /v1/models | 模型列表(需带 Key) |
| GET | /health | 健康检查(无需 Key) |
所有 /v1 端点都必须带 Key,否则 401。每个 Key 独立计配额、限速率。
chat/completions 请求参数一览
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
| model | string | 是 | 填 qwen3.8-flash-next-iq3_s(服务端不挑名字,填别的也能跑) |
| messages | array | 是 | 对话数组,role 取 system / user / assistant / tool |
| max_tokens | int | 否 | 输出上限;prompt+输出超 65536 会返回 400(不静默截断) |
| stream | bool | 否 | true = SSE 流式;思考内容在 delta 的 reasoning_content 字段 |
| temperature | float | 否 | 采样温度;不传任何采样参数时按贪心解码 |
| top_p / top_k / min_p | float/int | 否 | 核采样等;top_k 最多 64 候选(0 或 >64 = 不限制) |
| seed | int | 否 | 随机种子(默认自适应调度下不保证逐次复现) |
| presence_penalty / frequency_penalty / repetition_penalty | float | 否 | 惩罚项;可配 penalty_last_n(默认 64)限定统计窗口 |
| stop | string / array | 否 | 停止词,最多 4 个;命中即停且不下发该词 |
| reasoning_effort | string | 否 | 思考强度 none / low / medium / high(默认 high,模型先思考再答) |
| reasoning_budget_tokens | int | 否 | 思考 token 硬上限,到量强制收尾作答(0=不限) |
| tools / tool_choice | array | 否 | 标准 OpenAI 工具调用协议,流式下增量下发 |
| response_format | object | 否 | {"type":"json_object"} 或 json_schema(strict 校验,失败返回 502) |
| return_progress | bool | 否 | Strata 特有:流式空 delta 上带 prompt_progress 预填充进度 |
Anthropic 端点(/v1/messages)用其原生字段:
thinking、output_config.effort、stop_sequences。curl 示例
curl http://192.168.10.70:8787/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-你的Key" \
-d '{
"model": "qwen3.8-flash-next-iq3_s",
"messages": [{"role": "user", "content": "你好"}],
"max_tokens": 512,
"stream": false
}'Python(openai SDK)
from openai import OpenAI
client = OpenAI(
base_url="http://192.168.10.70:8787/v1",
api_key="***", # 网关「API Key 管理」页创建
)
r = client.chat.completions.create(
model="qwen3.8-flash-next-iq3_s",
messages=[{"role": "user", "content": "你好"}],
max_tokens=512,
)
print(r.choices[0].message.content)JavaScript(fetch 流式)
const res = await fetch("http://192.168.10.70:8787/v1/chat/completions", {
method: "POST",
headers: {
"Content-Type": "application/json",
"Authorization": "Bearer ***",
},
body: JSON.stringify({
model: "qwen3.8-flash-next-iq3_s",
messages: [{ role: "user", content: "你好" }],
stream: true,
}),
});
// 标准 OpenAI SSE:逐行读 data: {...}
// 正文在 delta.content,思考在 delta.reasoning_content响应与错误码
| 状态 | 含义 / 处理 |
|---|---|
| 200 | 成功;usage 含 prompt/completion/total tokens(流式在最后一个 chunk) |
| 401 | 没带 Key / Key 无效或已吊销 → 检查 Authorization 头,或到「API Key 管理」重新发 Key |
| 429 | 超过该 Key 的 RPM 速率或 Token 配额(响应里带 used/quota)→ 提配额或降频 |
| 400 | 请求非法 / prompt+max_tokens 超上下文 → 缩短对话或 max_tokens |
| 502 | json_schema 严格校验失败(模型输出不合 schema) |
| 连不上 | 网关没启动 → 本机双击 E:\OB\strata\gateway\START-GATEWAY.bat |
每次调用都会记进「调用日志」,Token 用量在「统计」页按 Key 汇总。
请求数
0
Prompt Token
0
Completion Token
0
平均耗时
0
毫秒
每日 Token(输入 / 输出堆叠)与请求数
输入 token
输出 token
请求数
按 Key 用量
| 名称 | 今日 | 区间合计 | 日配额 |
|---|
按端点 / 按模型
| 端点 | 次数 | Token |
|---|
| 模型 | 次数 | Token |
|---|
按来源 IP
| IP | 次数 |
|---|
状态码分布 / 异常提醒
| 状态 | 次数 |
|---|
| 名称 | Key | 创建时间 | 用量 | 今日 / 日配额 | 请求数 | RPM | 状态 |
|---|
吊销后该 Key 立即失效(401),历史统计保留;删除则连同 Key 记录移除(日志保留)。
| 时间 | Key | IP | 端点 | 流式 | 状态 | 输入 | 输出 | 合计 | 缓存 | 耗时 | 备注 |
|---|
网关配置(gateway.json)
改端口/上游后需重启网关进程生效。
数据与操作
命令行:
日志表 requests 永久保留;如需清理可自行执行
python gateway.py key add 名称 --daily 200000 --rpm 60python gateway.py stats --days 7python gateway.py recent --n 30日志表 requests 永久保留;如需清理可自行执行
DELETE FROM requests WHERE day<'2026-01-01'。