服务级别说明(SLA)
P1/P2/P3 分级标准、响应与恢复目标、服务时间、客户义务、排除项与赔偿上限。SLA 只写可测量、可资源化的内容。
面向已上线大模型系统的组织,提供巡检、监控、容量、升级、调优与SLA订阅服务:响应与恢复时间写明前提条件,变更先评审后执行,远程运维单独授权,赔偿上限按合同约定。
巡检、监控、容量、升级、调优与 SLA;可选服务,按服务级别与覆盖范围订阅。
运维的前提是把承诺写清楚:响应时限、服务时间、覆盖范围、排除项、远程授权方式与数据范围。启动顺序是巡检与监控先行(没有可观测性就没有运维),随后按变更控制流程处理升级、扩容与调优。我们只承诺可测量、可资源化的内容:响应时限以工作时间为界,恢复时间以客户配合、原厂供应、网络、云账号与第三方接口可用为前提。服务报告按周期出具,包含可用性、工单、变更与容量趋势,供客户内部汇报与续约决策使用。
内容包括:服务级别定义(P1/P2/P3 分级、响应与恢复目标、服务时间、排除项、赔偿上限);可观测性接入(硬件指标、推理服务指标、应用与网关日志、告警规则与通知渠道);日常巡检(容量、错误率、时延、存储与备份状态、证书与许可证到期);工单与变更流程(受理、分级、处置、验证、复盘);版本与升级管理(依赖、兼容性与回滚预案);容量与性能优化(并发、批处理、量化、检索与缓存调优);备份与恢复演练;安全运维(补丁、账号与密钥轮换、日志与审计核查);周期服务报告与改进建议。
运维承诺限于可测量、可资源化的内容。响应与恢复目标以工作时间为界,关键服务如需 7×24 支持须另行签署;恢复时间以客户配合、原厂备件供应、网络与机房条件、云账号与第三方接口可用为前提。服务报告中的可用性数据以监控记录为依据,双方可核验原始数据。任何绝对化承诺(如“零故障”“永不降级”“所有硬件故障当天修复”)均不在本服务范围内。
运维服务的六项内容,每项都有可交付、可核验的形式,避免“运维等于随时打电话”。
P1/P2/P3 分级标准、响应与恢复目标、服务时间、客户义务、排除项与赔偿上限。SLA 只写可测量、可资源化的内容。
硬件与推理服务指标、应用与网关日志、告警阈值与通知渠道、值班与升级路径。
按周期的巡检项:容量、错误率、时延、存储、备份状态、证书与许可证到期、日志与审计核查。
受理与分级、处置与验证、复盘与改进;生产变更走申请—评审—执行—验证—回滚流程。
版本升级与依赖兼容性评估、回滚预案、容量趋势分析与扩容建议。
按周期汇总可用性、工单、变更、容量与风险,作为内部汇报与续约决策依据。
SLA 争议多发生在分级口径上。下表把常见情形与响应方式对齐,双方在服务启动前确认。
| 级别 | 典型情形与严重程度 | 响应与处置方式 |
|---|---|---|
| P1 严重 | 服务整体不可用、疑似数据泄露、核心业务中断或关键数据损坏。 | 工作时间远程响应 ≤15 分钟 · 立即启动应急流程 |
| P2 主要 | 主要功能降级:检索异常、输出明显错误率上升、性能显著下降但可继续使用。 | 工作时间远程响应 ≤2 小时 · 当日给出处置方案 |
| P3 一般 | 一般咨询、参数调整、文档与优化建议、非关键功能异常。 | 工作时间响应 ≤1 个工作日 · 排期处理 |
| 计划性变更 | 版本升级、扩容、配置调整、密钥轮换等预安排操作。 | 提前提交变更单 · 约定窗口与回滚点 |
| 第三方依赖事件 | 外部模型接口、云服务、网络或原厂硬件故障导致的影响。 | 协助定位与协调 · 受第三方响应时限约束 |
| 7×24 关键支持 | 对不可中断业务提供的值守与随时响应。 | 另签补充协议 · 单独计价与排班 |
※ 恢复时间目标以客户配合、原厂供应、网络与机房条件为前提;确切时限与赔偿上限在合同与 SLA 文档中约定。
运维能力的底座是“看得见、测得准、改得动、退得回”四件事。
硬件、推理服务、应用与网关的分层可观测性;指标与日志分离存储,保留期按约定执行。
阈值与趋势双触发、告警降噪与聚合、通知渠道与升级路径,避免告警疲劳。
变更前评估依赖与影响面,准备回滚点;变更后验证核心功能与性能指标。
并发与批处理参数、量化与缓存策略、检索与索引调优,配合业务负载曲线验证效果。
按对象分层备份,定期演练恢复并记录耗时;明确 RPO/RTO 口径。
补丁评估与灰度、账号与密钥轮换、日志与审计核查、异常访问跟踪。
把巡检、告警处置与常见故障手册交付客户,降低对单一运维人员的依赖。
启动期 2—4 周建立可观测性与流程,之后按周期运行;升级与扩容按变更窗口执行。
与客户确认分级标准、响应与恢复目标、服务时间、客户义务与排除项,形成 SLA 文档。
按最小权限开通运维账号与远程通道,明确时间窗与操作留痕方式。
采集硬件、推理服务、应用与网关指标,配置阈值与告警通知,验证告警可达。
确定巡检周期与项目、工单受理与分级规则、值班与升级路径,并进行一次模拟演练。
建立变更单模板与回滚要求,完成一次版本升级或配置变更的完整流程验证。
按周期分析容量趋势与性能瓶颈,提出调优与扩容建议并按变更流程执行。
出具周期服务报告,与客户评审可用性、工单与变更统计、风险与改进项。
运维是长期关系,治理重点在于边界清楚、记录完整、责任可追。
系统上线之后的常见困境:没人看得懂告警、出事找不到人、升级不敢做、故障说不清责任。
运维带来的价值是把“不确定性”换成“可汇报的数字”和“可执行的流程”。
分级、时限、升级路径与留痕齐备,客户内部可以据此考核,不再依赖个人关系推动。
容量、时延、错误率与存储趋势按周期可见,扩容与优化决策基于数据而非感觉。
升级与扩容按流程执行并准备回滚,减少因变更引发的生产事故。
按服务级别、覆盖范围与实例数计价,容量建议基于趋势而非超额采购。
操作留痕、账号复核与日志审计支持内部审计与外部检查。
手册、流程与配置交付客户,具备条件时可转为自运维,不形成长期依赖。
※ 以上为服务内容与边界说明;SLA 承诺以签署的服务级别文档与合同为准,不包含绝对化可用性承诺。