需求说明书
任务类型、输入输出长度分布、并发与峰值、时延上限、精度要求、可接受的失败模式与人工兜底方式。指标口径必须可测量,禁止使用“效果要好”这类无口径描述。
模型选型服务:候选筛选、许可核验台账、算力需求初估与 PoC 建议,含排除项与前置条件。
需求—指标—成本—许可—算力矩阵与 PoC 建议;先选模型,再决定 RAG 或微调。
把“用哪个模型”变成一张可以辩论、可以复算的矩阵。选型输入包括任务类型、输入输出长度、并发与峰值、时延要求、精度要求、上下文长度、部署位置、预算区间与许可条件;输出是候选模型对比、排除理由、许可台账、算力需求口径与 PoC 建议书。我们逐版本核验权重许可、代码许可、训练与输出使用限制、商用条件与地域限制,结论以官方许可文本为准。选型不承诺某个模型在客户环境中的性能表现,也不做排他性推荐。
内容包括:需求与指标确认(任务类型、样本量、时延、并发、精度口径、可接受的失败模式);候选模型筛选(开源与商用、参数规模、上下文长度、量化与推理框架支持、语言与领域适配);许可核验(权重与代码分离、训练与输出限制、商用条件、复制与再分发、地域与备案要求);算力需求初估(精度、显存、批处理、并发与冗余的共同影响);部署位置匹配(本地、混合、托管);RAG 与微调的方法选择(先用检索还是先做微调);PoC 建议书(测试集、指标、基线、退出条件)。
选型结论不构成对客户环境性能、稳定性或合规状态的承诺;许可结论以官方许可文本为准,且会随版本更新而变化,台账中标注核验日期与适用版本。公开基准数据仅作为初筛参考,不作为性能承诺。
一份能被采购、法务与技术三方共同审核的选型结论,由六部分内容组成。
任务类型、输入输出长度分布、并发与峰值、时延上限、精度要求、可接受的失败模式与人工兜底方式。指标口径必须可测量,禁止使用“效果要好”这类无口径描述。
候选来源(开源、商用 API、原厂合作)、初筛维度(参数规模、上下文、语言、领域适配、推理框架支持)与筛选记录。
逐版本记录权重许可与代码许可、允许与限制用途、训练与输出使用条件、商用与再分发条件、地域与合规要求,附核验日期。
显存占用、吞吐、时延、并发能力的估算假设与公式;软件、硬件、算力、运维四段成本口径分列,不打包成单一数字。
RAG、提示工程、LoRA 微调、继续预训练的适用判断:数据量、任务形态、更新频率与可解释性要求共同决定方法。
测试集构成、样本量、指标定义、基线、通过条件、退出条件与投入估算,作为试点立项输入。
不同任务形态对模型的要求差异极大,选型必须从任务出发而不是从榜单出发。
| 任务形态 | 选型关注点 | 常见结论与把关人 |
|---|---|---|
| 长文检索问答 | 上下文长度、引用定位稳定性、长文召回质量;对参数量不敏感,对检索链路与切片质量更敏感。 | 中量级模型 + 检索优先 · 技术负责人 |
| 条款与结构化审阅 | 结构化输出稳定性、字段抽取准确率、格式遵循能力;通常需要输出约束与小样本提示。 | 结构化输出能力优先 · 业务负责人 |
| 文书与材料草稿 | 语言风格、术语一致性、可编辑性;对事实准确性的要求由人工复核承担。 | 风格与一致性优先 · 使用部门 |
| 高并发问答服务 | 吞吐与时延、量化后精度损失、并发下的显存与批处理策略。 | 吞吐与成本优先 · IT/运维 |
| 领域术语适配 | 通用模型对专业术语与内部表述的适配程度,是否需要 LoRA 微调或术语词典增强。 | 先 RAG 后微调 · 技术 + 业务 |
| 完全不出域 | 仅可部署本地开源权重或授权私有化交付的商用模型;许可条件与交付形式是硬约束。 | 本地可部署优先 · 法务 + IT |
选型的方法底座由五个判定工具组成,每个工具都能被客户复核。
把任务拆成检索、抽取、生成、判断、编排五类动作,分别对应模型与链路的要求,避免用一个模型解决所有环节。
权重许可 ≠ 代码许可;训练、输出使用、商用、再分发、地域限制逐项核验并留存文本来源与核验日期。
参数量、精度(FP16/INT8/INT4)、上下文长度、批处理、并发、KV 缓存与冗余共同决定显存与吞吐;给公式与假设,不给结论数字。
软件许可/实施、硬件采购、算力租赁或电力、运维人力四段分别估价,便于财务与采购分段审批。
对每个候选明确典型失败模式(幻觉、拒答、格式破坏、长文丢失、术语误用)与对应的兜底设计(人工复核、二次校验、拒答策略)。
用客户脱敏样本构建测试集,指标定义、样本量、评分方式与复测条件在开工前确认,保证结果可复算。
按 2—3 周口径的选型步骤;如包含实测对比(同环境跑 2—3 个候选),周期顺延。
与业务、技术、法务分别确认任务形态、指标口径、部署约束与许可底线,形成书面需求说明。
按部署形式(本地权重、私有化交付、API 托管)与规模分层收集候选,记录资料来源与版本信息。
逐候选逐版本核验权重与代码许可、训练与输出限制、商用条件;对存在限制的候选标注风险等级与备选方案。
按估算口径给出显存、吞吐与硬件量级区间,并做敏感性说明(并发翻倍、上下文翻倍时的影响)。
判定 RAG、提示工程或微调的优先顺序与组合方式,说明各自的前置条件与失败风险。
与客户共同评审选型矩阵与排除理由,逐条确认或修正;异议记录留档。
输出测试集、指标、基线、通过条件与退出条件,明确 PoC 所需环境与人员配合。
选型阶段的治理重点是:不制造隐性锁定,不让许可问题留到上线之后。
选型难的本质是:指标说不清、许可看不懂、成本算不准、结论不敢签字。
选型的产出不是一份推荐,而是一套可被复核、可被采购、可被反悔的判断依据。
每个结论都能追溯到许可文本、指标定义或测试数据,内部评审时经得起追问,法务与采购可独立复核。
显存与吞吐按估算口径推导,配合敏感性说明,避免按经验超额采购或反复补购。
训练、输出使用、商用与再分发限制提前识别,避免上线后因许可问题被迫更换模型或返工。
先判定 RAG 与微调的优先级,避免在数据不足时强行微调,或在该微调时错误地只做检索。
候选并列、理由公开、成本分列,客户可自行询价或在二期更换供应商,不存在技术锁定。
PoC 建议书给出退出条件与投入估算,可以先验证再扩围,失败不拖累整体预算。
※ 以上为服务内容与边界说明,不构成对具体项目效果的承诺;许可与性能结论以官方文本与客户环境实测为准。