事故响应与支持服务
最后更新:2026 年 8 月 12 日
1. 概述
GateLLM 是一款全私有化部署产品:网关进程运行在您(控制方)自有或受控的基础设施(VPC / 本地数据中心)内,Fluxon LLC(「处理方」)不托管运行时实例。因此,本文件不提供 SaaS 式的运行时可用性百分比承诺或服务信用补偿——那会误导为「这是一个 SaaS」,与「数据不出网、你自己掌控」的核心定位冲突。
本文件阐明的是:在全私有化部署模式下,处理方对软件缺陷修复、安全事件响应、许可证服务维护的响应承诺,以及支持服务分级。运行时实例的高可用由您的部署架构决定,我们提供部署指导(第 4 节)。事故响应流程(第 5 节)是采购方评估"出了事找谁、多久响应"的核心依据。
2. 处理方负责与不负责的边界
为避免责任错位,明确以下边界:
- 处理方负责:GateLLM 软件本身的缺陷修复与版本发布;安全漏洞的响应与修复(见漏洞披露政策);许可证签发服务的运营与维护;支持服务响应。
- 控制方负责:运行时实例的部署与运维(副本数、跨可用区、健康检查、自动故障转移);自有基础设施(网络、VPC、计算资源)的可用性;下游模型厂商服务的可用性(GateLLM 的跨厂商 fallback 已尽力缓解)。
- 运行时可用性:由您的部署架构决定,不由处理方保证。处理方提供 Helm Chart 与部署最佳实践指导您实现高可用(见第 4 节),但不为运行时实例的可用性百分比背书。
3. 许可证服务维护
许可证签发服务(License Service)在 GateLLM 实例启动时校验许可证有效性。处理方可能对该服务进行计划维护,约定如下:
- 提前通知:至少 72 小时通过您账户登记的邮箱通知
- 维护窗口:安排在低峰时段(协调世界时 UTC 凌晨 02:00-06:00)
- 维护时长:单次不超过 2 小时,月度累计不超过 4 小时
- 维护期间无业务影响:GateLLM 实例基于本地缓存的许可证继续运行宽限期(默认 14 天),计划维护期间网关进程正常工作,不中断服务
说明:此为许可证服务的维护安排说明,非运行时可用性承诺。即使许可证签发服务波动,宽限期机制也保障您的业务连续性——这正是全私有化部署的优势:核心数据流不依赖外部 SLO。
4. 网关进程高可用部署指导(控制方负责)
GateLLM 网关进程本身的高可用由您的部署架构决定。我们推荐以下部署实践以最大化运行时可用性:
- 多副本部署:通过 Helm Chart 部署 ≥ 2 个网关副本,配合负载均衡器分发流量
- 跨可用区:将副本分布在不同可用区(AZ),抵御单可用区故障
- 健康检查与自动重启:配置 Kubernetes liveness/readiness 探针,故障副本自动重启与摘流
- 无状态设计:网关进程不持有会话状态(密钥从配置加载至内存),任意副本可承接任意请求,支持水平扩展与即时故障转移
- 跨厂商 fallback:GateLLM 内置的跨厂商 fallback 机制在某下游模型厂商宕机时自动切换,从架构层保障模型调用可用性
- 本地缓存与宽限期:许可证本地缓存宽限、配置本地缓存,降低对外部依赖的实时性要求
上述措施可使网关进程的实际可用性达到 99.95% 以上(取决于您的部署配置与基础设施 SLA)。处理方提供详细的部署文档与架构评审支持,企业客户可联系 support@gatellm.io 获取一对一架构指导。
运行时可用性归根结底由您掌控——这是全私有化部署相对于 SaaS 的核心价值:不把业务连续性押在第三方的外部 SLO 上。
5. 事故响应流程
处理方建立以下事故响应流程,适用于影响 GateLLM 软件安全、稳定性或许可证服务的事件。事故按严重性分级并按对应时效响应:
5.1 事故分级
事故分为四级:
- P1 严重:GateLLM 软件存在正在被利用的安全漏洞影响生产数据,或关键软件缺陷导致无法使用且无变通方案。响应:15 分钟内确认,4 小时内缓解。
- P2 高危:发现高危安全漏洞,或关键软件缺陷影响核心功能。响应:1 小时内确认,8 小时内缓解。
- P3 中危:局部功能异常有变通方案,或发现中危安全漏洞。响应:4 小时内确认,1 个工作日内缓解。
- P4 低危:轻微问题不影响核心功能,或低危安全漏洞。响应:1 个工作日内确认,按漏洞披露政策时间表修复。
5.2 事故通知
事故通知机制:
- 通知渠道:控制方在账户登记的邮箱;P1/P2 事故额外电话通知(若登记了紧急联系人)
- 初步通知:事故确认后 30 分钟内发出,包含事故概述、影响范围、初步缓解措施
- 进展更新:P1 每 2 小时、P2 每 4 小时、P3 每 1 个工作日更新进展,直至解决
- 安全事件统一入口:security@gatellm.io,响应时效见漏洞披露政策
5.3 事故处理流程
事故处理遵循标准流程:
- 检测与确认:监控告警或客户报告触发,值班工程师确认事故并分级
- 缓解(Mitigation):优先止血,可能采用临时措施(如提供变通方案、发布热修复)
- 根因分析(RCA):缓解后深入定位根本原因
- 修复(Remediation):开发并发布正式修复版本
- 事后复盘(Post-mortem):P1/P2 事故在解决后 5 个工作日内出具事后报告,含时间线、根因、影响、改进措施与跟进项
- 改进跟进:复盘确定的改进项纳入跟踪,定期向受影响客户同步进展
控制方侧事故:由于网关运行时部署在您的基础设施内,运行时事故(如副本故障、配置错误、下游厂商宕机)由控制方在其环境内直接响应。GateLLM 提供完善的日志、监控指标与跨厂商 fallback 机制支持事故定位与恢复。处理方提供 7×24 关键事故支持(企业客户),协助定位与软件缺陷修复。
6. 支持服务级别
支持服务的响应级别:
- 企业版:7×24 关键事故(P1/P2)支持;P1 15 分钟、P2 1 小时响应;专属技术客户经理(TAM);季度架构评审
- Pro 版:工作日(9×5)支持;P1/P2 1 小时响应(工作时间内)
- 免费版:社区支持(文档 + 社区论坛),不保证响应时效
- 安全事件:所有版本均可在 security@gatellm.io 报告,按漏洞披露政策响应
7. 联系
支持与事故报告:support@gatellm.io。安全事件:security@gatellm.io。商务问题请联系您的专属客户经理或 support@gatellm.io。
数据处理协议(DPA) · 漏洞披露政策 · 安全与合规
GateLLM is a product of Fluxon LLC, a Delaware limited liability company.