第一层:数据目录
有哪些资料、在哪里、谁负责、多久更新一次、保留多久。没有目录的知识库无法审计,也无法判断某个结论是否还有效。
数据治理与知识库服务:盘点、分级、权限、脱敏、切片检索与版本化,含交付物、排除项与前置条件。
数据盘点、目录、权限、脱敏、切分、检索与版本化知识库;标准基础,可选深化。
把资料变成可检索、可引用、可追溯、可复核的知识库。工作顺序是:先盘点与分级,再定权限与脱敏规则,然后设计切片与检索策略,最后建立版本与复核机制。判断知识库是否可用的标准不是“能不能答”,而是每条回答能否回到原文位置、能否说明用了哪个版本、谁有权限看到什么、以及答错时谁来纠正。数据合法性、来源权利与保管责任由客户承担,我们不提供合法性背书。
内容包括:数据源盘点与目录(来源、类型、量级、更新频率、责任人);数据分类分级建议与权限矩阵(按角色与用途定义可访问范围);字段级脱敏规则与留痕要求;文档解析与切片策略(版面、表格、条款结构、页码与段落定位);检索策略(向量、关键词、混合检索与重排);引用定位与溯源;检索评测(样本、指标、基线);知识库版本、生效期与复核任务;增量更新与失效内容处理。
知识库的输出质量取决于原始资料质量、权限设计合理性以及使用者的复核习惯;服务商对治理流程、检索实现与文档交付负责,对资料本身的正确性、合法性与时效性不承担背书责任。检索评测结论仅对约定的测试集与评测口径成立,不外推为对所有业务问题的效果承诺。
知识库由六层内容构成,缺任何一层都会在使用阶段暴露为“搜得到但不敢用”。
有哪些资料、在哪里、谁负责、多久更新一次、保留多久。没有目录的知识库无法审计,也无法判断某个结论是否还有效。
按敏感度与用途分级,按角色授予检索、查看、导出权限;公开、内部、个人、敏感四档的可见范围必须显式定义。
字段级脱敏规则、片段最小化与出域前处理,确保进入检索与外部调用的内容不超出授权范围。
按文档结构(标题层级、条款、表格、页码)切片,保留可回指的定位信息,避免把长文切碎后失去上下文。
向量检索、关键词检索与混合策略的选择依据,重排策略、召回数量与阈值设定,以及命中率下降时的降级方式。
知识版本号、生效期、更新记录与复核任务;过期内容标注失效而不是静默留存,避免旧规范被当成现行要求引用。
同一套治理方法,在不同场景下的关键控制点不同。以下是四类典型数据形态与对应做法。
| 数据形态 | 典型场景与治理要点 | 关键产出与把关人 |
|---|---|---|
| 法规与制度类 | 政策、规范、内部制度的检索问答。要点:版本与生效期必须显式,回答需附条款出处,避免新旧版本混用。 | 制度版本台账 · 制度归口部门 |
| 业务文书类 | 合同、报告、审批材料、历史模板的检索与要点提取。要点:按结构切片保留条款与责任主体,敏感字段脱敏。 | 脱敏规则表 · 业务负责人 |
| 案卷与项目资料 | 案件材料、项目文档的归集与检索。要点:按项目/案件隔离,账号级权限,日志最小必要,默认不导入在办件全文。 | 权限矩阵 · 承办人 |
| 会议与服务记录 | 会议纪要、客服与坐席记录的沉淀与问答。要点:个人信息最小化,问答结果只做内部参考,不对外引用。 | 脱敏与最小化规则 · 合规负责人 |
| 科研与教学资料 | 论文、教材、课件与研究资料检索。要点:版权与许可状态标注,引用需保留出处,未成年人相关数据受控。 | 版权与许可标注 · 内容归口部门 |
工艺层决定知识库好不好用:我们用什么方法把“资料集合”变成“可用知识资产”。
面向 PDF、Word、扫描件、表格与多栏版面的解析策略,保留页码、章节与表格结构,为引用定位提供锚点。
按语义边界切片,同时保留粒度与上下文策略(父子块、重叠窗口),解决“切片太碎答不全、太大答不准”。
向量召回 + 关键词召回并行,再用重排模型按相关性排序;对术语、编号、专有名词类查询显式加强关键词通道。
每条回答附带原文片段与文件定位信息,支持点开核对原文;引用缺失时按规则降级为“未找到足够依据”。
从真实业务问题中抽取样本构建测试集,标注标准答案依据;评测口径(命中、引用正确性、拒答率)在开工前确认。
对接客户账号体系,检索前做权限过滤;对检索与导出行为留痕,日志范围遵循最小必要原则。
按 4—6 周口径的实施步骤,含客户配合节点与交付物;多源与大体量数据会延长解析与评测周期。
走访数据责任人,整理数据源清单、更新频率、责任人与保留期;确定纳入范围与暂不纳入的清单。
按敏感度与用途分级,定义角色可见范围与检索过滤规则,与客户数据负责人和 IT 逐项确认。
定义字段级脱敏规则,抽取样本验证脱敏效果与可读性平衡,记录验证过程。
按文档类型配置解析与切片策略,处理表格、条款与多栏版面;抽取 30—50 份样本做人工核对。
配置检索链路与重排策略,用测试集迭代召回与排序参数,记录每轮改动与效果对比。
按约定口径出评测结果,逐条复盘未达项归因(解析、切片、检索、权限或数据本身),形成改进清单。
建立版本号、生效期、更新流程与复核任务;培训内容与数据责任人使用复核与下架流程。
※ 周期按单部门、单语种、资料结构相对规范的试点口径估算;多语种、扫描件为主或跨部门权限复杂时会显著延长。
知识库的治理不是一次性审批,而是六条常设机制,贯穿上线后的日常运行。
知识库项目失败通常不是模型不行,而是治理没做,导致“搜得到、不敢用、没法追责”。
可检索只是起点,真正的收益是让专业人员的检索与整理时间下降,同时把答案的可核验性提高。
把跨文件、跨目录的查找与摘录从人工翻找变为按引用定位的核对;收益可通过同一批任务的耗时对比测量,而不是用宣传数字代替。
每条输出带来源定位,专业人员核对原文的时间大幅短于从零检索;对外使用前的把关责任仍在专业人手中。
资料、目录与检索结果成为组织资产;人员变动时交接对象是知识库与规则,而不是个人经验。
分级、脱敏、权限与留痕在建设阶段一次做完,后续接入外部模型或审计时不需要补历史材料。
交付包含规则、索引与评测材料,客户可换供应商或在自建环境复现,不必被单一厂商绑定。
先做单部门试点验证效果与权限,再按效果扩围;未通过评测不进入大规模接入,避免一次性大投入。
※ 以上为服务内容与边界说明,不构成对具体项目效果的承诺;检索评测结论仅对约定的测试集与评测口径成立。
知识库建设基础步骤
标准基础能力
按字段级规则执行
含检索评测记录
可选深化能力
——
——
——
——
① 盘点与目录 → ② 分级与权限矩阵确认 → ③ 脱敏规则设计与核验 → ④ 解析与切片策略 → ⑤ 索引与检索策略 → ⑥ 检索评测与调优 → ⑦ 版本与复核机制上线 → ⑧ 权限与评测材料交付评审。