中级调用方 + 管理员
从症状出发排障:z-request-id 定位 401 / 502 / 流式中断
按 z-request-id 全链路定位 401 / 403 / 404 / 502 / 503 / 超时 / 流式中断 / 内存异常 —— 不再靠猜。
社区真正在抱怨什么
StackOverflow 高频:"流式响应经代理后变成一坨"、"tool calling 的 JSON 拼不起来"、"429 到底是限流还是配额超了"、"502 是网关还是厂商的锅"。AI 调用排障难在:多跳链路、流式、错误码不统一,出问题不知道卡在哪一跳。
GateLLM 怎么做
GateLLM 给每个请求分配 z-request-id,全链路串联日志,按症状定位:401 / 403 看鉴权与 Header ACL,404 看路由,502 / 503 看上游健康,超时看限流与跨海,流式中断看缓冲与 SSE,内存异常看配置。错误码归一化(多厂商错误语义统一),流式原生透传不缓冲,Token Ops 日志可查可导出。
落地的 5 个手段
- z-request-id 全链路串联日志,按 id 一键定位
- 按症状分流:401 / 403 / 404 / 502 / 503 / 超时 / 流式中断 / 内存异常
- 错误码归一化:多厂商错误语义统一为一致口径
- 流式原生透传不缓冲,不破坏 SSE 与 tool calling
- Token Ops 日志可查可导出,接入排障与对账