ZRJRUIJIE.AI// GATEWAY_OS

网关 — Strata — 最近请求 —

实时监控 · 每 2 秒刷新 · 滚动窗口约 4 分钟

采样中…

模型输出吞吐

–
 

请求速率

–
网关实测 · 次/分

GPU 使用率

–
 

GPU 温度 / 显存

–
 

CPU 使用率

–
 

CPU 温度

–
主板 ACPI 热敏区(需管理员权限启动网关才可读取)

内存使用率

–
 

今日请求

0
累计 0 次

今日 Token

0
累计 0

今日错误

0
4xx / 5xx / 499

启用中的 Key

0
网关运行 —

今日逐小时请求量

近 14 天 Token 用量

最近 10 次调用

时间Key端点状态 Token耗时
可将本页接入信息和示例保存为 Markdown 文档。

接入信息(其他电脑用这个)

Base URL(局域网)
http://192.168.10.70:8787/v1
Base URL(公网 HTTPS)
(隧道未运行)
Base URL(本机)
http://127.0.0.1:8787/v1
模型名(model 参数)
qwen3.8-flash-next-iq3_s
鉴权 Header
Authorization: Bearer *** 网关发的 sk-... Key》
备选鉴权 Header
x-api-key: <Key>
上下文长度
65,536 tokens(输入+输出共享)
协议
OpenAI Chat / OpenAI Responses / Anthropic Messages,均支持流式与工具调用
任何"OpenAI 兼容"客户端(Open WebUI、Cherry Studio、LobeChat、openai SDK 等)填上面 Base URL + Key 即可。Key 在「API Key 管理」页创建。
局域网外的用户用「Base URL(公网 HTTPS)」那一行的地址(后面同样接 /v1);该地址由 Cloudflare 隧道生成,隧道或电脑重启后会变,变了要重新告知用户。下方示例里的地址按需替换成公网地址。

网关开放的端点

方法端点说明
POST/v1/chat/completions聊天补全(最常用,流式/非流式、tools、JSON 模式)
POST/v1/responsesOpenAI Responses API(Codex CLI 等)
POST/v1/messagesAnthropic Messages(Claude Code 等)
GET/v1/models模型列表(需带 Key)
GET/health健康检查(无需 Key)
所有 /v1 端点都必须带 Key,否则 401。每个 Key 独立计配额、限速率。

chat/completions 请求参数一览

参数类型必填说明
modelstring是填 qwen3.8-flash-next-iq3_s(服务端不挑名字,填别的也能跑)
messagesarray是对话数组,role 取 system / user / assistant / tool
max_tokensint否输出上限;prompt+输出超 65536 会返回 400(不静默截断)
streambool否true = SSE 流式;思考内容在 delta 的 reasoning_content 字段
temperaturefloat否采样温度;不传任何采样参数时按贪心解码
top_p / top_k / min_pfloat/int否核采样等;top_k 最多 64 候选(0 或 >64 = 不限制)
seedint否随机种子(默认自适应调度下不保证逐次复现)
presence_penalty / frequency_penalty / repetition_penaltyfloat否惩罚项;可配 penalty_last_n(默认 64)限定统计窗口
stopstring / array否停止词,最多 4 个;命中即停且不下发该词
reasoning_effortstring否思考强度 none / low / medium / high(默认 high,模型先思考再答)
reasoning_budget_tokensint否思考 token 硬上限,到量强制收尾作答(0=不限)
tools / tool_choicearray否标准 OpenAI 工具调用协议,流式下增量下发
response_formatobject否{"type":"json_object"} 或 json_schema(strict 校验,失败返回 502)
return_progressbool否Strata 特有:流式空 delta 上带 prompt_progress 预填充进度
Anthropic 端点(/v1/messages)用其原生字段:thinking、output_config.effort、stop_sequences。

curl 示例

curl http://192.168.10.70:8787/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-你的Key" \
  -d '{
    "model": "qwen3.8-flash-next-iq3_s",
    "messages": [{"role": "user", "content": "你好"}],
    "max_tokens": 512,
    "stream": false
  }'

Python(openai SDK)

from openai import OpenAI

client = OpenAI(
    base_url="http://192.168.10.70:8787/v1",
    api_key="***",   # 网关「API Key 管理」页创建
)
r = client.chat.completions.create(
    model="qwen3.8-flash-next-iq3_s",
    messages=[{"role": "user", "content": "你好"}],
    max_tokens=512,
)
print(r.choices[0].message.content)

JavaScript(fetch 流式)

const res = await fetch("http://192.168.10.70:8787/v1/chat/completions", {
  method: "POST",
  headers: {
    "Content-Type": "application/json",
    "Authorization": "Bearer ***",
  },
  body: JSON.stringify({
    model: "qwen3.8-flash-next-iq3_s",
    messages: [{ role: "user", content: "你好" }],
    stream: true,
  }),
});
// 标准 OpenAI SSE:逐行读 data: {...}
// 正文在 delta.content,思考在 delta.reasoning_content

响应与错误码

状态含义 / 处理
200成功;usage 含 prompt/completion/total tokens(流式在最后一个 chunk)
401没带 Key / Key 无效或已吊销 → 检查 Authorization 头,或到「API Key 管理」重新发 Key
429超过该 Key 的 RPM 速率或 Token 配额(响应里带 used/quota)→ 提配额或降频
400请求非法 / prompt+max_tokens 超上下文 → 缩短对话或 max_tokens
502json_schema 严格校验失败(模型输出不合 schema)
连不上网关没启动 → 本机双击 E:\OB\strata\gateway\START-GATEWAY.bat
每次调用都会记进「调用日志」,Token 用量在「统计」页按 Key 汇总。

请求数

0

Prompt Token

0

Completion Token

0

平均耗时

0
毫秒

每日 Token(输入 / 输出堆叠)与请求数

输入 token 输出 token 请求数

按 Key 用量

名称今日区间合计日配额

按端点 / 按模型

端点次数Token
模型次数Token

按来源 IP

IP次数

状态码分布 / 异常提醒

状态次数
配额单位:token。留空 = 不限。
名称Key创建时间用量今日 / 日配额 请求数RPM状态
吊销后该 Key 立即失效(401),历史统计保留;删除则连同 Key 记录移除(日志保留)。
时间KeyIP端点流式状态 输入输出合计 缓存耗时备注

网关配置(gateway.json)

改端口/上游后需重启网关进程生效。

数据与操作

命令行:
python gateway.py key add 名称 --daily 200000 --rpm 60
python gateway.py stats --days 7
python gateway.py recent --n 30
日志表 requests 永久保留;如需清理可自行执行 DELETE FROM requests WHERE day<'2026-01-01'。

新建 API Key