评测方案(先于训练)
指标定义、测试集来源与样本量、评分方式、基线取值与复测条件。没有测试集的训练等于无法验收。
微调与训练服务:数据方案、训练配置、模型版本、评测与回滚,含许可与数据前置条件。
数据方案、训练代码/配置、模型版本、测试与回滚;可选服务,按范围评估。
在数据、许可与评测三个前提都成立之后再动训练,是这项服务的第一条纪律。工作路径是:先定义评测口径与测试集,再设计数据方案(样本筛选、标注规范、合规核验),然后选择方法(LoRA、指令微调或继续预训练),执行训练并用同一测试集对比基线与实际值,最后建立模型版本命名、存档与回滚机制。训练不承诺超越基座模型的能力边界,不把输出质量的责任从业务复核转移到模型本身;训练日志与中间权重按合同约定保存或删除。
内容包括:评测方案设计(指标定义、测试集构成、样本量、评分方式、复测条件);数据方案(样本筛选标准、标注规范、去重与污染检查、合规与许可核验);方法选择(LoRA/QLoRA、指令微调、继续预训练,含参数规模与显存的匹配);训练执行(超参配置、算力分配、检查点与回滚点);模型评测(基线—实际对比、失败样本归因);模型版本管理(命名、存档、发布与回滚);交付与知识转移(配置、脚本、评测报告与操作说明);模型输出标识与使用规范说明。
微调的效果取决于数据质量、任务定义与评测口径;服务商对训练过程、配置交付与评测结论负责,不对业务结果作承诺。评测结论仅在约定的测试集与口径下成立,不外推为对所有输入的表现。若样本量、标注质量或算力条件不满足方法要求,服务商会书面提出“建议先做检索增强或不启动训练”的替代结论。
训练类项目的失败往往发生在训练之前。内容体系用五个前置物把风险挡在开工前。
指标定义、测试集来源与样本量、评分方式、基线取值与复测条件。没有测试集的训练等于无法验收。
样本筛选标准、标注规范、去重与污染检查(避免测试集混入训练集)、格式与长度分布统计。
样本来源与授权范围、许可对训练与输出使用的约定、敏感信息处理方式与保留期限。
按样本量、任务形态、更新频率与算力条件判断 LoRA / 指令微调 / 继续预训练的适配度与预期收益。
超参、显存分配、检查点频率、失败重试与回滚点设置,保证训练过程可复现、可中断恢复。
模型版本号、适配文件命名、发布范围、灰度与回滚方式,以及与知识库版本的对齐关系。
什么情况下该训练、什么情况下不该训练,是这项服务最需要说清楚的部分。
| 任务与数据情形 | 方法判断与理由 | 预期产出与把关人 |
|---|---|---|
| 知识类问答,资料频繁更新 | 优先检索增强(RAG)而不是训练:知识更新只需更新知识库,训练会让模型“记住”过期内容且无法追溯来源。 | 建议:先 RAG · 技术负责人 |
| 输出风格与格式不稳定 | 适合小样本指令微调或输出约束:目标是稳定结构、统一术语,不需要改变知识边界。 | 建议:LoRA 小样本 · 使用部门 |
| 专业术语与内部表述适配 | 适合 LoRA:用领域语料调整表达习惯;样本量有限时避免全量微调,防止灾难性遗忘。 | 建议:LoRA · 技术 + 业务 |
| 需要模型掌握特定领域推理链 | 需要较大规模高质量样本与更高算力;若样本不足,应先做数据建设而不是先开训。 | 建议:先评估样本 · 项目组 |
| 样本量少且无标注规范 | 不建议启动训练:先用提示工程与检索验证任务可行性,同时补数据与标注规范。 | 结论:暂不训练 · 业务负责人 |
| 许可不允许训练或输出使用 | 不启动训练:更换基座模型或改用检索方案,许可限制优先于效果诉求。 | 结论:换基座或改方案 · 法务 |
训练类交付的技术底座,重点是可复现、可回滚、可对比,而不是调参技巧。
样本清洗、去重、分词长度统计、类别分布检查与训练/验证/测试划分,并做训练—测试污染检查。
LoRA/QLoRA 的秩、目标模块、学习率与轮次配置;低显存条件下的可行性方案与效果权衡。
在样本与算力条件满足时使用;配套学习率预热、梯度累积、混合精度与检查点策略。
基线—实际对比、失败样本分类(知识缺失、格式错误、指令遵循、幻觉),区分数据问题与训练问题。
模型版本、适配文件、训练配置与评测报告一一对应;发布前演练回滚路径。
生成合成内容的标识要求、对外使用规范与免责说明,纳入交付的使用规则中。
按 4—8 周口径(取决于样本规模与算力);样本准备与标注往往占用一半以上时间。
与业务确认指标定义与评分方式,从真实任务抽取样本构建测试集,冻结基线测量口径。
制定筛选与标注规范,抽样复核标注质量,核查样本来源与许可限制,输出核验记录。
按样本量与方法要求给出“可训练 / 先补数据 / 改做检索”的书面结论,避免无效投入。
在既有模型(未微调)上跑测试集,取得基线值作为对比锚点。
按配置执行训练,中途按检查点评测,记录每轮次的关键指标与资源占用。
用同一测试集对比基线与微调后模型,逐类分析失败样本,区分数据、方法与预期设定问题。
版本命名、适配文件与配置归档,演练一次回滚,确认可恢复到上一个可用版本。
交付脚本、配置与操作说明,培训客户技术方执行再训练与模型替换流程。
训练环节的治理集中在三条线:数据与许可的合规线、训练过程的留痕线、模型发布的责任线。
微调最常见的三类损失:数据不够就开训、没有基线无法验收、上线之后没人会维护。
训练类投入的价值必须能用同一口径对比出来,否则就是不确定的预算消耗。
基线、测试集、样本量与评分方式全部留档,效果结论可被第三方复核,而不是一份“效果良好”的说明。
在开工前给出“可训练 / 先补数据 / 改做检索”的书面判断,把算力与人工花在能产生结果的地方。
针对格式不稳、术语不统一等问题做定向训练,减少下游人工整理与二次校对成本。
版本与配置一一对应,发布前演练回滚,避免“新版本不稳但回不去”的生产事故。
脚本、配置与适配文件交付客户,具备算力时客户可自行再训练,不依赖服务商长期驻场。
样本授权、许可限制与处置方式全部留痕,审计与法务复核有据可依。
※ 以上为服务内容与边界说明;微调不承诺超越基座模型能力,评测结论仅在约定测试集与口径下成立。
训练前置标准动作
可选服务,按范围评估
——
——
① 评测口径与测试集确认 → ② 数据方案与合规核验 → ③ 方法选择与可行性判断 → ④ 基线测量 → ⑤ 训练与中间评测 → ⑥ 对比评测与失败样本归因 → ⑦ 版本归档与回滚演练 → ⑧ 交付、培训与使用规范说明。