OnvergeAi 临界AI
SOLUTIONS · OnvergeAi

模型选型

模型选型服务:候选筛选、许可核验台账、算力需求初估与 PoC 建议,含排除项与前置条件。

服务 03 · 模型选型

需求—指标—成本—许可—算力矩阵与 PoC 建议;先选模型,再决定 RAG 或微调。

把“用哪个模型”变成一张可以辩论、可以复算的矩阵。选型输入包括任务类型、输入输出长度、并发与峰值、时延要求、精度要求、上下文长度、部署位置、预算区间与许可条件;输出是候选模型对比、排除理由、许可台账、算力需求口径与 PoC 建议书。我们逐版本核验权重许可、代码许可、训练与输出使用限制、商用条件与地域限制,结论以官方许可文本为准。选型不承诺某个模型在客户环境中的性能表现,也不做排他性推荐。

服务范围构成
标准服务 2 项 · 可选服务 0 项
排除项 0 项 · 前置条件 2 项
计价与报价口径
按阶段包计价
按阶段包或人天(含许可核验工作量)
服务属性
默认纳入标准范围
证据等级 B · 复核周期 90 天

服务范围(我们做什么)

内容包括:需求与指标确认(任务类型、样本量、时延、并发、精度口径、可接受的失败模式);候选模型筛选(开源与商用、参数规模、上下文长度、量化与推理框架支持、语言与领域适配);许可核验(权重与代码分离、训练与输出限制、商用条件、复制与再分发、地域与备案要求);算力需求初估(精度、显存、批处理、并发与冗余的共同影响);部署位置匹配(本地、混合、托管);RAG 与微调的方法选择(先用检索还是先做微调);PoC 建议书(测试集、指标、基线、退出条件)。

交付内容

  • · 模型选型矩阵(表格):候选模型逐项对比(能力、许可、算力、成本、生态)与每项结论的依据
  • · 排除理由说明(文档):被排除的候选及原因(许可、性能、生态、适配、成本),便于客户复核
  • · 许可证台账(台账):模型、版本、许可文本来源与核验日期、权重与代码许可区分、限制条款摘要
  • · 算力需求口径说明(文档):显存、吞吐、时延与并发的估算公式、假设条件与敏感性说明
  • · PoC 建议书(文档):测试集来源与规模、指标定义、基线取值、通过条件与退出条件

前置条件(需要客户提供)

  • · 明确任务与指标口径:客户给出任务类型、期望输入输出长度、时延上限与可接受的失败类型
  • · 明确部署约束:数据是否可出域、是否要求纯本地、机房与算力现状、网络条件
  • · 明确预算与许可底线:是否接受商用许可、是否可接受外部 API、许可费用与硬件预算量级
  • · 提供可评测样本:脱敏样本或测试集用于 PoC 期的效果与性能验证,样本权利由客户保证

责任边界(我们不承担什么)

选型结论不构成对客户环境性能、稳定性或合规状态的承诺;许可结论以官方许可文本为准,且会随版本更新而变化,台账中标注核验日期与适用版本。公开基准数据仅作为初筛参考,不作为性能承诺。

需客户授权或提供:需客户提供:任务与指标要求、部署与数据出域约束、预算量级、用于 PoC 的脱敏样本(如涉及);如后续需要接入客户环境做实测,需另行授权环境访问范围与操作类型。
01

内容体系

一份能被采购、法务与技术三方共同审核的选型结论,由六部分内容组成。

需求说明书

任务类型、输入输出长度分布、并发与峰值、时延上限、精度要求、可接受的失败模式与人工兜底方式。指标口径必须可测量,禁止使用“效果要好”这类无口径描述。

责任:业务 + 技术确认

候选池与筛选记录

候选来源(开源、商用 API、原厂合作)、初筛维度(参数规模、上下文、语言、领域适配、推理框架支持)与筛选记录。

产出:候选清单

许可核验台账

逐版本记录权重许可与代码许可、允许与限制用途、训练与输出使用条件、商用与再分发条件、地域与合规要求,附核验日期。

责任:法务复核

算力与成本口径

显存占用、吞吐、时延、并发能力的估算假设与公式;软件、硬件、算力、运维四段成本口径分列,不打包成单一数字。

产出:口径说明

方法选择结论

RAG、提示工程、LoRA 微调、继续预训练的适用判断:数据量、任务形态、更新频率与可解释性要求共同决定方法。

产出:方法建议

PoC 建议书

测试集构成、样本量、指标定义、基线、通过条件、退出条件与投入估算,作为试点立项输入。

产出:PoC 计划
02

场景矩阵

不同任务形态对模型的要求差异极大,选型必须从任务出发而不是从榜单出发。

任务形态选型关注点常见结论与把关人
长文检索问答上下文长度、引用定位稳定性、长文召回质量;对参数量不敏感,对检索链路与切片质量更敏感。中量级模型 + 检索优先 · 技术负责人
条款与结构化审阅结构化输出稳定性、字段抽取准确率、格式遵循能力;通常需要输出约束与小样本提示。结构化输出能力优先 · 业务负责人
文书与材料草稿语言风格、术语一致性、可编辑性;对事实准确性的要求由人工复核承担。风格与一致性优先 · 使用部门
高并发问答服务吞吐与时延、量化后精度损失、并发下的显存与批处理策略。吞吐与成本优先 · IT/运维
领域术语适配通用模型对专业术语与内部表述的适配程度,是否需要 LoRA 微调或术语词典增强。先 RAG 后微调 · 技术 + 业务
完全不出域仅可部署本地开源权重或授权私有化交付的商用模型;许可条件与交付形式是硬约束。本地可部署优先 · 法务 + IT
03

能力底座

选型的方法底座由五个判定工具组成,每个工具都能被客户复核。

任务—能力映射

把任务拆成检索、抽取、生成、判断、编排五类动作,分别对应模型与链路的要求,避免用一个模型解决所有环节。

方法:任务拆解

许可核验框架

权重许可 ≠ 代码许可;训练、输出使用、商用、再分发、地域限制逐项核验并留存文本来源与核验日期。

方法:逐版本核验

容量估算口径

参数量、精度(FP16/INT8/INT4)、上下文长度、批处理、并发、KV 缓存与冗余共同决定显存与吞吐;给公式与假设,不给结论数字。

方法:估算模型

成本四段法

软件许可/实施、硬件采购、算力租赁或电力、运维人力四段分别估价,便于财务与采购分段审批。

方法:分列口径

失败模式分析

对每个候选明确典型失败模式(幻觉、拒答、格式破坏、长文丢失、术语误用)与对应的兜底设计(人工复核、二次校验、拒答策略)。

方法:失败模式清单

评测与基线设计

用客户脱敏样本构建测试集,指标定义、样本量、评分方式与复测条件在开工前确认,保证结果可复算。

方法:评测方案
04

工程实现

按 2—3 周口径的选型步骤;如包含实测对比(同环境跑 2—3 个候选),周期顺延。

  1. 1

    第 1 步:需求与指标确认(D1—D2)

    与业务、技术、法务分别确认任务形态、指标口径、部署约束与许可底线,形成书面需求说明。

    交付:需求说明书
  2. 2

    第 2 步:候选池构建(D3—D5)

    按部署形式(本地权重、私有化交付、API 托管)与规模分层收集候选,记录资料来源与版本信息。

    交付:候选清单
  3. 3

    第 3 步:许可核验(D4—D8)

    逐候选逐版本核验权重与代码许可、训练与输出限制、商用条件;对存在限制的候选标注风险等级与备选方案。

    交付:许可证台账
  4. 4

    第 4 步:算力与成本估算(D6—D9)

    按估算口径给出显存、吞吐与硬件量级区间,并做敏感性说明(并发翻倍、上下文翻倍时的影响)。

    交付:算力口径说明
  5. 5

    第 5 步:方法匹配(D8—D10)

    判定 RAG、提示工程或微调的优先顺序与组合方式,说明各自的前置条件与失败风险。

    交付:方法建议
  6. 6

    第 6 步:矩阵评审(D10—D12)

    与客户共同评审选型矩阵与排除理由,逐条确认或修正;异议记录留档。

    参与:业务 + 技术 + 法务
  7. 7

    第 7 步:PoC 建议书(D12—D14)

    输出测试集、指标、基线、通过条件与退出条件,明确 PoC 所需环境与人员配合。

    交付:PoC 建议书
05

治理保障

选型阶段的治理重点是:不制造隐性锁定,不让许可问题留到上线之后。

许可留痕
每个候选的许可结论附文本来源、版本号与核验日期;许可更新时按约定周期复审并通知客户。机制:台账复审
避免排他绑定
不做独家代理式推荐;候选池包含可替代型号与替代方案,客户可自行比价采购。机制:多候选并列
无承诺表述
对外与文档中不使用绝对化效果承诺;性能与效果结论限定在测试环境与测试集口径内。机制:内容复核
方法选择可解释
为什么先做 RAG 而不是微调、为什么量化到某个精度,均给出依据与权衡,不留给“经验之谈”。机制:决策记录
客户确认节点
需求口径、矩阵结论、PoC 条件三处必须由客户书面确认后进入下一步。机制:书面确认
退出条件明确
PoC 未达条件时的回退路径(换模型、改方法、调整范围或终止)在开工前约定。机制:退出条件
06

解决什么问题

选型难的本质是:指标说不清、许可看不懂、成本算不准、结论不敢签字。

“哪个模型最好”无法回答
现状:榜单与宣传互相矛盾,团队争论无法收敛。动作:把问题从“最好”改为“满足哪组指标、在什么约束下”,用矩阵逐项比较。
许可看不懂
现状:“可下载”被当成“可商用”,权重与代码许可混为一谈。动作:逐版本核验并出具台账,标注限制条款与风险等级。
算力需求说不清
现状:凭经验买卡,买多了浪费、买少了不够。动作:给出估算公式、假设条件与敏感性说明,作为采购需求书输入。
不知道先做检索还是先做微调
现状:直接上微调,数据不够效果好不了,投入打水漂。动作:按数据量、任务形态与更新频率做方法匹配,明确优先级。
试点做完了说不清结论
现状:没有基线,无参照可比较。动作:PoC 建议书预定义测试集、基线与通过条件,结果可复算可评审。
采购被绑定
现状:报价里模型、硬件、服务打包,无法拆分比较。动作:软件、硬件、算力、运维四段分列,留下比价空间。
07

客户价值与优势

选型的产出不是一份推荐,而是一套可被复核、可被采购、可被反悔的判断依据。

决策有据可查

每个结论都能追溯到许可文本、指标定义或测试数据,内部评审时经得起追问,法务与采购可独立复核。

收益:可审计决策

投入更精准

显存与吞吐按估算口径推导,配合敏感性说明,避免按经验超额采购或反复补购。

收益:减少无效采购

避免许可陷阱

训练、输出使用、商用与再分发限制提前识别,避免上线后因许可问题被迫更换模型或返工。

收益:合规风险前置

方法少走弯路

先判定 RAG 与微调的优先级,避免在数据不足时强行微调,或在该微调时错误地只做检索。

收益:少做无效工作

保留选择权

候选并列、理由公开、成本分列,客户可自行询价或在二期更换供应商,不存在技术锁定。

收益:议价空间

试点可控

PoC 建议书给出退出条件与投入估算,可以先验证再扩围,失败不拖累整体预算。

收益:风险受控

※ 以上为服务内容与边界说明,不构成对具体项目效果的承诺;许可与性能结论以官方文本与客户环境实测为准。

标准服务

许可核验与许可证台账

逐版本核验权重与代码许可

交付物:许可证台账(含核验日期与许可文本哈希)

选型矩阵与排除理由

含算力与成本口径

交付物:选型矩阵、排除理由说明

前置条件

需明确任务、并发、时延与预算

——

交付物:——
前提:客户提供指标要求与预算范围

许可须允许训练与输出使用

——

交付物:——
前提:模型许可逐版本核验通过

服务过程

① 需求与指标确认 → ② 候选池筛选与资料收集 → ③ 逐版本许可核验 → ④ 算力与成本口径估算 → ⑤ 部署位置与路由方案匹配 → ⑥ 选型矩阵与排除理由评审 → ⑦ PoC 建议书与测试计划交付。

获取模型选型矩阵 服务流程与阶段 报价构成说明

先做一次 30 分钟的需求梳理

说出你的行业、数据边界与预算区间,我们在 1 个工作日内给出可验证的下一步。