性质:非客户案例
本页为演示环境构造的能力示例,全部文件、字段、测试集与结果均为示例数据,不涉及真实客户、真实案件或真实指标。
非客户案例:以下为演示环境构造的示例数据,用于说明案卷检索、引用定位与文书草稿的方法、流程与交付物
以下为演示环境构造的示例数据,用于说明方法与交付物。示例画像为某律师事务所类组织的一个诉讼团队:12 名律师,在办与归档材料合计约 4.8 万页,格式含可搜索 PDF、扫描件、Word 往来函件与 Excel 台账。示例希望在不改变现有办案流程的前提下,把「翻找材料、摘录事实、套用模板」三段重复劳动压缩,并让每一条输出都能回到原文位置。系统只做检索、定位、抽取与草稿,不做案件判断,也不出具法律意见;对外文书一律由承办律师修改并署名负责。
在演示环境的示例测试集上验证四项可复算能力:检索命中与未命中提示、引用定位完整、草稿骨架可编辑、复核留痕可查。所有指标均为示例口径,不代表任一客户环境的结果。
示例数据全部在演示环境中构造:150 份示例案卷与脱敏合同,由公开模板改写与随机字段替换生成,含姓名、案号、金额字段的替换规则,不含真实案件信息与个人信息原始值;授权文件为虚构的示例授权书;示例保留期 90 天;禁止用途为模型训练、对外发布与跨团队检索。生产环境中可入库范围、隔离粒度与保留期需由客户按自身授权与制度确认,本示例的规则只用于说明方法。
这一节先说明它是什么、不是什么:以下为演示环境构造的示例数据,用于说明方法与交付物,不涉及真实客户与真实案件。
本页为演示环境构造的能力示例,全部文件、字段、测试集与结果均为示例数据,不涉及真实客户、真实案件或真实指标。
示例画像为某律师事务所类组织的一个诉讼团队(12 名律师、约 4.8 万页示例材料),用于说明任务链路与人工复核位置,不代表任何机构。
材料由公开模板改写与随机字段替换生成,姓名、案号、金额按脱敏规则处理;测试集由示例问答 150 条与库外问题 25 条构成,口径记录在评测记录中。
检索命中与未命中提示、引用定位完整、草稿骨架可编辑、复核留痕可查;每项均给出基线、目标与实际三列(示例口径)。
材料入库、事实摘录、文书草稿、检索评测、上线前检查共 5 个节点,节点责任人与判定规则在权限矩阵中逐条列出。
不做案件判断、不出具法律意见、不代替律师与委托人沟通、不自动提交材料、不生成可直接对外的定稿文书。
按环节看数据怎么走、谁在哪个环节把关;示例中的每一行都对应客户环境里需要书面确认的一项。
| 环节 | 示例数据与处理方式 | 输出与把关角色 |
|---|---|---|
| 材料入库 | 150 份示例案卷只读入库;可入库范围、隔离粒度与保留期在书面确认后生效。 | 案件管理员确认 |
| 解析与切分 | 可搜索 PDF 直接抽取;扫描件先做文本识别;按文书类型与段落切分,保留文件与页码坐标。 | 技术负责人抽检 |
| 索引与权限 | 按团队与案件划分索引,检索前执行权限过滤;跨团队检索请求直接拒绝并留痕。 | IT/安全负责人确认 |
| 检索与引用 | 向量召回与关键词召回合并重排,命中片段随答案输出;无命中时给出明确提示,不用推测内容补位。 | 承办律师核对原文 |
| 草稿生成 | 按 4 类模板生成骨架并填入引用片段,不做结论性表述,保留生成版本记录。 | 承办律师修改并署名 |
| 留痕与退出 | 检索、导出、权限变更与复核行为留痕;示例保留期 90 天,到期按约定删除并出具记录。 | IT/安全负责人 + 项目管理 |
※ 示例中的保留期、隔离粒度与禁止用途均为演示口径,客户环境需按自身授权与制度重新确认。
结果按示例口径列出,同时把没做到的、失败项的写清楚,避免把示例数字当成效果承诺。
把示例里的步骤换成你自己的材料与责任人,即为一次可验收的试点节奏。
确认可入库材料范围、隔离粒度、脱敏规则、保留期与禁止用途,指定复核责任人。
用自有材料抽样构造问答集与库外问题集,先确定基线、指标定义与样本量,再开始调优。
按材料类型与问题类型分开评测,定位是切分、召回还是重排问题,逐项记录未达项归因。
适配自有文书模板,把复核节点写进操作规范,明确未确认内容不得对外使用。
用越权访问、批量导出、离职账号等用例验证隔离与留痕,形成权限矩阵。
对照前置条件与验收脚本逐项确认;未达项逐条列明,是否扩围由客户评审决定并书面记录。
路线为纯私有化:材料只读入库后进入隔离空间解析、切片与索引,检索前做权限过滤,输出统一附带引用片段与文件定位;草稿用模板加检索片段生成,不做结论性表述。示例环境使用 7B 级开源中文模型做摘要与草稿生成,以检索为主、生成为辅;长文档先切片再按需拼接上下文,避免一次性把整卷材料塞进上下文。检索与生成组件通过只读接口对接,草稿以工作底稿状态保存,未经复核确认不得导出。
第 1—2 周:示例资料盘点、分类分级与脱敏规则确认,冻结可入库范围与保留期;第 3—4 周:解析切分与检索评测,运行 150 条示例问答与 25 条库外问题,记录命中与引用定位结果;第 5—7 周:草稿模板适配与复核流程跑通,记录 5 个复核节点的确认与版本;第 8—9 周:权限用例与日志验证,含跨团队越权访问的拒绝用例;第 10 周:扩围准备、培训与验收材料整理,输出升级条件与退出路径。每个阶段均设客户确认节点,未确认不进入下一阶段。
示例交付物包括:数据分类分级与脱敏规则说明、权限矩阵、检索与引用评测记录(含测试集构成与未达项归因)、4 类文书草稿模板与操作规范、复核节点记录模板、验收脚本与测试用例、培训材料与运维交接说明。所有交付物均按示例数据编制,客户环境中需按自身授权范围、保留期与内部制度重新确认后才可使用;交付物不含可直接对外的文书成品,也不构成法律意见。
以下为演示环境构造的示例数据,用于说明方法与交付物。150 条示例问答上,引用定位完整率为 96%、示例基线 78%(示例数据);25 条库外问题均给出未命中提示并转人工(示例数据);12 组越权访问用例的请求均被拒绝并留痕(示例数据)。这些数字只反映演示环境的示例测试集,不构成客户案例,也不代表任一客户环境的预期结果;上线后需以客户自有测试集重新评测。
示例范围:材料解析入库、检索与引用定位、草稿模板与复核流程、权限与日志配置、评测记录与培训。不含与委托人沟通、不含对外提交材料、不含案件判断与法律意见,这些均属客户方职责。
未覆盖场景:跨案卷关联推理、多语言材料、手写体与版式高度混排的材料、语音与视频证据。已知失败项:扫描件质量差(倾斜、缺页、分辨率低)时文本识别失败或召回明显下降;长表格与跨页续表抽取不稳定,需要人工二次校对;专业简称与内部缩写未被示例词表覆盖时检索不到;引用定位为页码级而非行级,仍需人工核对原文位置。
示例口径:示例测试集扩大到 300 条且引用定位完整率稳定在示例目标之上、扫描件补录规则固化后,再评审是否扩围到第二个团队;扩围前需重新确认数据授权、保留期与权限矩阵。
文档解析与切分组件:(示例版本)支持可搜索 PDF、Word、Excel 与扫描件,扫描件先做文本识别再进入切分;本地检索组件:(示例版本)向量召回与关键词召回合并后重排,保留命中片段与页码定位信息;权限与日志组件:(示例版本)按团队与案件隔离索引,检索、导出与权限变更行为留痕;评测脚本与测试集:(示例版本)示例测试集 150 条问答加 25 条库外问题,指标与口径记录在评测记录中;草稿模板库:(示例版本)4 类常用文书的骨架模板,含必填字段与引用占位符
(示例)某开源中文模型 7B 级(示例口径,非指定品牌);(示例)本地向量数据库
(示例)客户本地服务器:控制面与数据面均在本地,检索与生成不出局域网(示例口径)
材料入库与脱敏 · 案件管理员:确认可入库范围与脱敏规则执行结果后放行;事实摘录 · 承办律师:逐条对照原文位置核对,未核对内容不得进入草稿;文书草稿 · 承办律师:对外使用前人工修改并署名负责;检索评测 · 技术负责人:确认测试集构成、指标口径与未达项归因;上线前检查 · IT/安全负责人:确认账号隔离、日志留存与数据保留期设置
(示例)检索脚本、评测脚本、草稿模板、权限与日志组件、运维监控(示例口径)
扫描件质量差时的解析与召回:倾斜、缺页、低分辨率的示例材料出现识别失败,需人工补录后重新入库;长表格与跨页续表抽取:示例材料中跨页表格字段错位,输出需人工二次校对;跨案卷关联推理:示例未覆盖,系统不做跨案卷事实推演;专业简称与内部缩写检索:示例词表未覆盖时出现检索不到,需扩充同义词表后复测;对外文书定稿:示例不生成可直接对外的定稿文书,需律师改写并署名
| 指标 | 测试集 | 样本 | 基线 | 目标 | 实际 | 状态 |
|---|---|---|---|---|---|---|
| 引用定位完整率 | 示例测试集 A(示例案卷 120 条问答) | 120 | 示例基线 78% | 示例目标 ≥95% | 示例实际 96% | 达标(示例口径) |
| 未命中提示率 | 构造无命中集(20 条) | 20 | 示例基线 0% | 示例目标 ≥95% | 示例实际 96% | 达标(示例口径) |
| 草稿人工修改率 | 示例草稿样本 40 份 | 40 | 示例基线 65% | 示例目标 ≤45% | 示例实际 52% | 未达预期(示例口径) |
本材料用于说明方法、流程和交付物,不构成客户案例,不保证在任一客户环境中取得相同结果;文中全部文件、字段、测试集与指标均为演示环境构造的示例数据。