OnvergeAi 临界AI
SOLUTIONS · OnvergeAi

数据治理与知识库

数据治理与知识库服务:盘点、分级、权限、脱敏、切片检索与版本化,含交付物、排除项与前置条件。

服务 02 · 数据治理与知识库

数据盘点、目录、权限、脱敏、切分、检索与版本化知识库;标准基础,可选深化。

把资料变成可检索、可引用、可追溯、可复核的知识库。工作顺序是:先盘点与分级,再定权限与脱敏规则,然后设计切片与检索策略,最后建立版本与复核机制。判断知识库是否可用的标准不是“能不能答”,而是每条回答能否回到原文位置、能否说明用了哪个版本、谁有权限看到什么、以及答错时谁来纠正。数据合法性、来源权利与保管责任由客户承担,我们不提供合法性背书。

服务范围构成
标准服务 4 项 · 可选服务 1 项
排除项 3 项 · 前置条件 1 项
计价与报价口径
按阶段包计价
按范围包或人天(深化部分按工作量评估)
服务属性
默认纳入标准范围 · 可选服务
证据等级 C · 复核周期 90 天

服务范围(我们做什么)

内容包括:数据源盘点与目录(来源、类型、量级、更新频率、责任人);数据分类分级建议与权限矩阵(按角色与用途定义可访问范围);字段级脱敏规则与留痕要求;文档解析与切片策略(版面、表格、条款结构、页码与段落定位);检索策略(向量、关键词、混合检索与重排);引用定位与溯源;检索评测(样本、指标、基线);知识库版本、生效期与复核任务;增量更新与失效内容处理。

交付内容

  • · 数据目录与分级建议(表格):数据源清单、责任人、更新频率、分级与保留期建议
  • · 权限矩阵(矩阵):角色 × 数据类型 × 操作(查看/检索/导出)的授权范围
  • · 脱敏规则表(规则表):字段级脱敏方式、触发条件与留痕要求
  • · 知识库应用与切片说明(应用 + 文档):解析、切片、索引、检索与引用定位的实现说明
  • · 检索评测记录(报告):测试集构成、指标定义、基线与实际值、未达项与原因
  • · 版本与复核机制说明(文档):知识版本、生效期、失效处理与复核责任的运行规则

前置条件(需要客户提供)

  • · 资料授权与使用目的确认:客户书面确认资料来源、权利归属与允许用途,含是否可用于检索、摘要与训练
  • · 数据责任人到位:每一类数据源需有明确的业务责任人,负责内容正确性与版本更新
  • · 可提供样本环境:提供脱敏样本或受限样本用于解析与检索调试,避免直接接入生产库
  • · 权限体系可对接:客户具备账号与角色体系(AD/LDAP/SSO 或内部系统),否则需先约定临时权限方案

责任边界(我们不承担什么)

知识库的输出质量取决于原始资料质量、权限设计合理性以及使用者的复核习惯;服务商对治理流程、检索实现与文档交付负责,对资料本身的正确性、合法性与时效性不承担背书责任。检索评测结论仅对约定的测试集与评测口径成立,不外推为对所有业务问题的效果承诺。

需客户授权或提供:需客户书面授权:可纳入知识库的资料范围与来源、使用目的与期限、脱敏要求、保留期与销毁方式、是否可用于模型训练或评测、以及跨角色可见范围。
01

内容体系

知识库由六层内容构成,缺任何一层都会在使用阶段暴露为“搜得到但不敢用”。

第一层:数据目录

有哪些资料、在哪里、谁负责、多久更新一次、保留多久。没有目录的知识库无法审计,也无法判断某个结论是否还有效。

责任:业务责任人

第二层:分类分级与权限

按敏感度与用途分级,按角色授予检索、查看、导出权限;公开、内部、个人、敏感四档的可见范围必须显式定义。

责任:数据负责人 + IT

第三层:脱敏与最小化

字段级脱敏规则、片段最小化与出域前处理,确保进入检索与外部调用的内容不超出授权范围。

责任:法务确认 + 系统执行

第四层:解析与切片

按文档结构(标题层级、条款、表格、页码)切片,保留可回指的定位信息,避免把长文切碎后失去上下文。

交付:切片与定位说明

第五层:检索与重排

向量检索、关键词检索与混合策略的选择依据,重排策略、召回数量与阈值设定,以及命中率下降时的降级方式。

交付:检索策略说明

第六层:版本与复核

知识版本号、生效期、更新记录与复核任务;过期内容标注失效而不是静默留存,避免旧规范被当成现行要求引用。

机制:版本与复核台账
02

场景矩阵

同一套治理方法,在不同场景下的关键控制点不同。以下是四类典型数据形态与对应做法。

数据形态典型场景与治理要点关键产出与把关人
法规与制度类政策、规范、内部制度的检索问答。要点:版本与生效期必须显式,回答需附条款出处,避免新旧版本混用。制度版本台账 · 制度归口部门
业务文书类合同、报告、审批材料、历史模板的检索与要点提取。要点:按结构切片保留条款与责任主体,敏感字段脱敏。脱敏规则表 · 业务负责人
案卷与项目资料案件材料、项目文档的归集与检索。要点:按项目/案件隔离,账号级权限,日志最小必要,默认不导入在办件全文。权限矩阵 · 承办人
会议与服务记录会议纪要、客服与坐席记录的沉淀与问答。要点:个人信息最小化,问答结果只做内部参考,不对外引用。脱敏与最小化规则 · 合规负责人
科研与教学资料论文、教材、课件与研究资料检索。要点:版权与许可状态标注,引用需保留出处,未成年人相关数据受控。版权与许可标注 · 内容归口部门
03

能力底座

工艺层决定知识库好不好用:我们用什么方法把“资料集合”变成“可用知识资产”。

结构化解析

面向 PDF、Word、扫描件、表格与多栏版面的解析策略,保留页码、章节与表格结构,为引用定位提供锚点。

实现:解析流水线

切片与锚点设计

按语义边界切片,同时保留粒度与上下文策略(父子块、重叠窗口),解决“切片太碎答不全、太大答不准”。

实现:切片策略

混合检索与重排

向量召回 + 关键词召回并行,再用重排模型按相关性排序;对术语、编号、专有名词类查询显式加强关键词通道。

实现:检索链路

引用定位与溯源

每条回答附带原文片段与文件定位信息,支持点开核对原文;引用缺失时按规则降级为“未找到足够依据”。

实现:溯源链路

评测集构建

从真实业务问题中抽取样本构建测试集,标注标准答案依据;评测口径(命中、引用正确性、拒答率)在开工前确认。

交付:评测方案

权限与审计对接

对接客户账号体系,检索前做权限过滤;对检索与导出行为留痕,日志范围遵循最小必要原则。

实现:权限与审计集成
04

工程实现

按 4—6 周口径的实施步骤,含客户配合节点与交付物;多源与大体量数据会延长解析与评测周期。

  1. 1

    第 1 步:数据盘点与目录(W1)

    走访数据责任人,整理数据源清单、更新频率、责任人与保留期;确定纳入范围与暂不纳入的清单。

    交付:数据目录
  2. 2

    第 2 步:分级与权限设计(W1—W2)

    按敏感度与用途分级,定义角色可见范围与检索过滤规则,与客户数据负责人和 IT 逐项确认。

    交付:权限矩阵
  3. 3

    第 3 步:脱敏规则与核验(W2)

    定义字段级脱敏规则,抽取样本验证脱敏效果与可读性平衡,记录验证过程。

    交付:脱敏规则表 + 验证记录
  4. 4

    第 4 步:解析与切片(W2—W3)

    按文档类型配置解析与切片策略,处理表格、条款与多栏版面;抽取 30—50 份样本做人工核对。

    交付:切片与定位说明
  5. 5

    第 5 步:检索策略与调优(W3—W4)

    配置检索链路与重排策略,用测试集迭代召回与排序参数,记录每轮改动与效果对比。

    交付:检索评测记录
  6. 6

    第 6 步:评测与评审(W4—W5)

    按约定口径出评测结果,逐条复盘未达项归因(解析、切片、检索、权限或数据本身),形成改进清单。

    交付:评测报告
  7. 7

    第 7 步:版本与复核机制上线(W5—W6)

    建立版本号、生效期、更新流程与复核任务;培训内容与数据责任人使用复核与下架流程。

    交付:机制说明 + 培训

※ 周期按单部门、单语种、资料结构相对规范的试点口径估算;多语种、扫描件为主或跨部门权限复杂时会显著延长。

05

治理保障

知识库的治理不是一次性审批,而是六条常设机制,贯穿上线后的日常运行。

权限最小化与隔离
按角色过滤检索范围,跨部门知识默认不互通;账号与权限变更纳入客户既有流程,服务商不留后门账号。机制:权限定期复核
数据分类分级落地
每一类数据有明确分级与对应处理方式(可否入库、可否外发、能否用于训练),分级结果登记在目录中。机制:分级登记
引用与溯源强制
输出必须附带来源定位;无来源的结论按规则降级,不允许无依据生成。机制:溯源校验
人工复核点
内容归口部门负责知识正确性;对涉及规范、金额、责任与对外使用的输出,设置人工确认环节。机制:复核任务流
日志与审计
记录检索、查看、导出与权限变更行为,日志范围与保留期按客户制度与合同约定执行。机制:日志与审计记录
版本与失效管理
内容更新产生新版本并标注生效期;旧版本转为历史档或下架,避免过期规范继续被引用。机制:版本台账
退出与可迁移
索引与规则以可导出形式交付,项目终止时可迁移至客户自建环境或由其他服务商接手。机制:交付可迁移
06

解决什么问题

知识库项目失败通常不是模型不行,而是治理没做,导致“搜得到、不敢用、没法追责”。

资料散落,找不到
现状:资料分散在个人电脑、共享盘与邮件里,找一份现行版本要问三个人。动作:建立统一目录与责任人对齐。
找到了但不知道是不是现行版
现状:新旧规范混杂,引用错版本造成返工。动作:版本号与生效期显式化,过期内容标注失效。
答错了查不出原因
现状:输出看起来合理,但无法核对原文,出错只能整体停用。动作:强制引用定位,配合评测集定位是解析、切片还是检索问题。
越权可见
现状:不同部门、不同项目的人能看到不该看的资料。动作:检索前权限过滤 + 跨域隔离 + 行为留痕。
不知道该不该外发
现状:混合部署或外部模型场景下,谁也不知道哪些字段可以出去。动作:分级 + 脱敏规则 + 出域前审批与留痕。
上线后没人维护
现状:内容半年不更新,用户逐渐不用。动作:复核任务与更新流程交给内容责任人,形成可考核的运行机制。
07

客户价值与优势

可检索只是起点,真正的收益是让专业人员的检索与整理时间下降,同时把答案的可核验性提高。

检索与整理时间下降

把跨文件、跨目录的查找与摘录从人工翻找变为按引用定位的核对;收益可通过同一批任务的耗时对比测量,而不是用宣传数字代替。

衡量:同任务耗时对比

答案可核验

每条输出带来源定位,专业人员核对原文的时间大幅短于从零检索;对外使用前的把关责任仍在专业人手中。

衡量:引用正确率(测试集口径)

知识沉淀不随人流失

资料、目录与检索结果成为组织资产;人员变动时交接对象是知识库与规则,而不是个人经验。

衡量:目录覆盖率

合规动作前置

分级、脱敏、权限与留痕在建设阶段一次做完,后续接入外部模型或审计时不需要补历史材料。

衡量:检查项完成度

可迁移不锁定

交付包含规则、索引与评测材料,客户可换供应商或在自建环境复现,不必被单一厂商绑定。

衡量:交付物完整性

分阶段可控投入

先做单部门试点验证效果与权限,再按效果扩围;未通过评测不进入大规模接入,避免一次性大投入。

衡量:试点验收条件

※ 以上为服务内容与边界说明,不构成对具体项目效果的承诺;检索评测结论仅对约定的测试集与评测口径成立。

标准服务

数据盘点与目录

知识库建设基础步骤

交付物:数据目录、责任人清单与保留期建议

分级与权限矩阵

标准基础能力

交付物:数据分类分级建议、权限矩阵

脱敏规则设计

按字段级规则执行

交付物:脱敏规则表与执行说明

知识库构建(切片/检索/引用定位)

含检索评测记录

交付物:知识库应用、检索评测记录、引用定位说明

可选服务

知识库深化(多源接入与重排优化)

可选深化能力

交付物:多源接入方案、重排策略与评测对比记录

排除项

不提供自动数据清洗兜底

——

交付物:——
排除:数据质量与完整性由客户保障

不提供数据永久保管

——

交付物:——
排除:保留期按合同与最小必要原则约定

不提供数据合法性背书

——

交付物:——
排除:数据权利、来源与授权由客户负责

前置条件

需取得资料授权与使用目的确认

——

交付物:——
前提:客户书面授权处理目的、期限与范围

服务过程

① 盘点与目录 → ② 分级与权限矩阵确认 → ③ 脱敏规则设计与核验 → ④ 解析与切片策略 → ⑤ 索引与检索策略 → ⑥ 检索评测与调优 → ⑦ 版本与复核机制上线 → ⑧ 权限与评测材料交付评审。

预约数据治理诊断 服务流程与阶段 报价构成说明

先做一次 30 分钟的需求梳理

说出你的行业、数据边界与预算区间,我们在 1 个工作日内给出可验证的下一步。