跳到主要内容

运行设置

管理台 设置 页改的是运行层:熔断、重试、流式、日志捕获、会话亲和、计费。保存后对下一个请求立即生效,不用改 config.yaml,也不用重启。监听地址和登录账号仍在 配置 的启动层。

熔断策略

禁用粒度是 模型 × 密钥,不是整把上游 key、也不是整条路由。

默认语义
熔断阶梯连续失败后的冷却时长,默认沿 30s → 1m → 3m 升级,末档重复
禁用阈值连续失败多少次后禁用该组合,默认 3,之后需手动解禁
单请求最大转移模型数默认 3。按路由权重依次换模型;每个模型会先用完自己的可用密钥,再计一次 hop

401 / 403 通常立即禁用该组合;429 走短冷却,若响应带 Retry-After 则优先用它。路由页和配置中心都可以解禁。

重试

说明
重试冷却秒数429 且没有 Retry-After 时使用
可重试 HTTP 状态码命中后先换同模型其他密钥,该模型密钥都失败再换下一个路由模型

流式处理

说明
流式空闲超时首字节之后如果长时间没有新 chunk 就断开
自动注入 include_usage对 OpenAI completions 流式请求补 stream_options.include_usage,方便记精确 token

提供商上的「首字响应超时」只卡建连和首字节;长输出流交给这里的空闲超时,不会被整体截断。

日志与捕获

元数据(次数、token、时延、费用、状态)始终记。正文是另一回事:

  • 捕获成功请求默认关。关掉时仍会记录真正转发失败的请求/响应,方便排查
  • 路由全部实例无效、根本没发出上游请求时,无论开关都不记正文
  • 打开后成功失败都写入本地 content_log,注意敏感数据
  • 白名单可限制哪些逻辑路由或 provider/model 直达要捕获;空 = 全部
  • 内容日志、请求日志各有保留天数;0 表示请求日志永久保留

设置页底部的危险操作可以立即按保留期清理,或清空统计(内容日志会留下)。

会话亲和

打开后,同一会话尽量打到上次成功的 模型 + 密钥,方便命中上游提示缓存。

  • 会话 ID 请求头可配多个,按顺序取第一个有值的,例如 X-Session-ID
  • 客户端没带头时,按消息前缀哈希自动识别
  • TTL 到了重新选

计费

说明
美元兑人民币汇率模型若用人民币定价,按此折成美元入库;仪表盘/统计可切换展示币种
STT 上传上限语音识别 multipart 上限,默认 25 MB(OpenAI 官方上限),Groq 等可调高

模型自己的输入价 / 缓存价 / 输出价 / 按次价在 配置中心 的模型表单里填。虚拟密钥预算按这里折算后的美元累计。