运行设置
管理台 设置 页改的是运行层:熔断、重试、流式、日志捕获、会话亲和、计费。保存后对下一个请求立即生效,不用改 config.yaml,也不用重启。监听地址和登录账号仍在 配置 的启动层。
熔断策略
禁用粒度是 模型 × 密钥,不是整把上游 key、也不是整条路由。
| 项 | 默认语义 |
|---|---|
| 熔断阶梯 | 连续失败后的冷却时长,默认沿 30s → 1m → 3m 升级,末档重复 |
| 禁用阈值 | 连续失败多少次后禁用该组合,默认 3,之后需手动解禁 |
| 单请求最大转移模型数 | 默认 3。按路由权重依次换模型;每个模型会先用完自己的可用密钥,再计一次 hop |
401 / 403 通常立即禁用该组合;429 走短冷却,若响应带 Retry-After 则优先用它。路由页和配置中心都可以解禁。
重试
| 项 | 说明 |
|---|---|
| 重试冷却秒数 | 429 且没有 Retry-After 时使用 |
| 可重试 HTTP 状态码 | 命中后先换同模型其他密钥,该模型密钥都失败再换下一个路由模型 |
流式处理
| 项 | 说明 |
|---|---|
| 流式空闲超时 | 首字节之后如果长时间没有新 chunk 就断开 |
自动注入 include_usage | 对 OpenAI completions 流式请求补 stream_options.include_usage,方便记精确 token |
提供商上的「首字响应超时」只卡建连和首字节;长输出流交给这里的空闲超时,不会被整体截断。
日志与捕获
元数据(次数、token、时延、费用、状态)始终记。正文是另一回事:
- 捕获成功请求默认关。关掉时仍会记录真正转发失败的请求/响应,方便排查
- 路由全部实例无效、根本没发出上游请求时,无论开关都不记正文
- 打开后成功失败都写入本地
content_log,注意敏感数据 - 白名单可限制哪些逻辑路由或
provider/model直达要捕获;空 = 全部 - 内容日志、请求日志各有保留天数;
0表示请求日志永久保留
设置页底部的危险操作可以立即按保留期清理,或清空统计(内容日志会留下)。
会话亲和
打开后,同一会话尽量打到上次成功的 模型 + 密钥,方便命中上游提示缓存。
- 会话 ID 请求头可配多个,按顺序取第一个有值的,例如
X-Session-ID - 客户端没带头时,按消息前缀哈希自动识别
- TTL 到了重新选
计费
| 项 | 说明 |
|---|---|
| 美元兑人民币汇率 | 模型若用人民币定价,按此折成美元入库;仪表盘/统计可切换展示币种 |
| STT 上传上限 | 语音识别 multipart 上限,默认 25 MB(OpenAI 官方上限),Groq 等可调高 |
模型自己的输入价 / 缓存价 / 输出价 / 按次价在 配置中心 的模型表单里填。虚拟密钥预算按这里折算后的美元累计。