OnvergeAi 临界AI
OnvergeAi · OnvergeAi

单证字段抽取与关务核对

面向物流操作岗与关务岗:从提单、装箱单与报关资料中提取关键字段,与现行资料清单逐项比对齐备性,输出缺失项、待确认项与原文定位;不判断商品归类、不产出申报结论,进入申报流程前由对应岗位确认,确认人、时间与版本留存。

所属行业:交通物流与运输 · 场景编号 SC-087 · 证据等级 B

这个场景做什么

把提单、装箱单、报关资料等单证中的关键字段提取出来,与现行资料清单逐项比对齐备性,输出缺失项、待确认项与原文定位,供操作岗与关务岗逐条核对。系统做到「列出字段、比对清单、标出出处」为止:不判断商品归类,不产出申报结论,不生成可直接提交的数据包。抽取结果默认是内部工作底稿,进入申报流程前必须由对应岗位确认,确认人、时间与版本留存。

单证版式差异大、扫描件比例高(字段抄录与齐备性核对占用操作岗大量时间,错漏常到报关或派送环节才暴露)
同一票业务多份单证字段口径不一致(人工逐份核对重复劳动多,差异项容易漏过)
资料清单散落在邮件、群消息与个人笔记(新人与支援岗上手慢,齐备性判断随人波动)
客户与货物信息属商业数据(不能随意送到外部模型处理,需要事先划定可见岗位与审批路径)

能力边界

不判断商品归类,不产出申报结论与合规意见;不代替操作岗与关务岗作出申报决定;不生成可直接提交监管部门的数据包;不把提取结果直接写入申报系统;涉及许可要件与监管条件的内容只列出出处与缺失项,由关务岗确认。

01

场景分析

这个场景处理的链路是:单证入库 → 解析与切片 → 字段提取 → 清单比对 → 人工核对 → 留痕交接。前四步是效率收益来源,后两步决定结果能不能用。

环节一:单证入库与登记

单证以只读方式入库,登记票号、业务线与来源;同一票业务的多版本标注版本关系,避免用错版本。

产出:单证登记表

环节二:解析与定位

解析表格结构与栏目,保留页码与字段位置,为每个字段提供可回溯的原文锚点。

实现:解析与切片

环节三:字段提取

按字段模板抽取船名航次、箱号封号、件重尺与金额等字段,缺失字段明确标为未提取到。

产出:字段清单

环节四:齐备性与一致性比对

与现行齐备性检查表比对缺失项,并比对同一票业务多份单证之间的记载差异。

产出:缺失项与差异项清单

环节五:人工核对与确认

操作岗核对字段与齐备性,关务岗确认申报口径;未确认内容不得进入申报流程。

复核:操作岗 + 关务岗

环节六:留痕与交接

记录确认人、时间与版本,形成可流转的交接清单,支持事后追溯。

机制:复核记录
02

输入输出与复核

每一步的输入、处理方式、输出与把关角色必须写清,否则系统整理出来的东西没人敢拿去用。

环节输入与处理方式输出与把关角色
单证入库输入:提单、装箱单、报关资料等(只读)。处理:登记票号与业务线,标注版本关系。输出:登记表 · 操作岗
字段提取输入:入库单证。处理:按字段模板抽取并附页码定位;精确项走关键词与规则通道。输出:字段清单 · 操作岗
齐备性核对输入:检查表配置与单证。处理:逐项比对必备资料,输出缺失项与待确认项。输出:缺失项清单 · 操作岗
一致性比对输入:同一票业务多份单证。处理:比对品名、数量、金额与日期记载差异。输出:差异项清单 · 操作岗
口径确认输入:候选品名与编号、许可类文件清单。处理:只列出处与缺失项,不作归类判断。输出:待确认清单 · 关务人员
留痕与交接输入:已确认项与未确认项。处理:记录确认人、版本与导出行为。输出:交接记录 · 操作主管
03

治理保障

本场景的治理规则围绕申报责任不转移、精确项优先、权限与日志三条主线展开,全部可落到系统配置。

申报责任不转移
齐备性核对只输出缺失项与待确认清单,申报内容与许可要件由关务岗确认。依据:海关法如实申报要求
岗位与业务线隔离
客户与货物信息只在需要的岗位可见,导出与分享行为留痕。机制:权限过滤
精确项优先
箱号、封号、提单号等精确项走关键词与规则通道,避免语义检索漏项。机制:混合检索
日志最小必要
记录必要字段与操作行为,不落全文日志;保留期按双方制度与合同约定执行。机制:日志策略
检查表版本管理
齐备性检查表与字段模板按月核对,变更留版本,过期条目停用。机制:版本管理
外发审批
涉及外部模型的调用须在任务允许、字段脱敏、客户批准的前提下进行并留痕。机制:外发审批
04

价值与衡量方式

收益用可测量的方式描述:同一票型的耗时对比、缺失项判定情况、字段定位比例与核对返工情况。

核对耗时对比
衡量方式:选取同一票型的 10—20 票单证,分别统计人工整理与系统辅助后所需的人工核对耗时,形成对比基线。口径:同票型耗时对比
缺失项识别情况
衡量方式:在约定测试集上统计缺失项判定正确与被误报的条目数,无法判定的标为待确认。口径:缺失项判定与误报
字段定位可核验
衡量方式:统计字段清单中能定位到原文位置的比例,未定位项降级为未提取到。口径:定位比例(测试集)
核对返工情况
衡量方式:统计复核阶段被退回修改的条目数与原因分布,用于定位解析或字段映射问题。口径:返工条目与原因
交接可追溯
衡量方式:检查交接记录中确认人、时间与版本是否齐全,抽查可追溯比例。口径:记录完整性
合规可交代
衡量方式:检查边界、权限、日志、复核四类检查项的完成度与留痕完整性。口径:检查项完成度

※ 以上为方法说明与衡量口径,不构成对具体项目效果的承诺;结果受单证版式差异、扫描件质量与核对流程影响。

场景的结构化说明

典型任务
抽取船名航次、提单号、收发货人、件重尺等字段,逐项附原文页码与位置,供操作岗核对:提单字段提取;按箱号、封号、件重尺比对装箱单与提单记载,不一致项单列并标注差异位置:装箱单与箱封号核对;按既定清单核对合同、发票、装箱单与许可类文件是否齐备,输出缺失项与待确认清单:报关资料齐备性核对;比对同一票业务多份单证的品名、数量、金额与日期记载,列出不一致处与出处:单证间一致性比对;按历史记录检索相似品名与编号写法,仅作候选提示,编号与归类口径由关务岗确认:品名与商品编号候选定位;汇总缺失项、冲突项与责任岗位,生成交接清单随业务流转并留版本:待确认清单与交接记录
适用前提
客户确认单证与关务资料的可用范围、使用目的与留存要求(资料取得授权且来源可追溯);逐类登记可入库资料、只读引用资料与一律不进系统的资料(明确可处理与禁止外发范围);由操作与关务岗提供现行齐备性检查表与字段定义,作为比对基准(既有资料清单与字段口径可用);明确字段齐备性由操作岗负责,申报口径由关务岗负责(指定核对人与责任岗位)
推荐部署
纯私有化;混合部署
推荐架构
默认纯私有化:单证在隔离空间内解析、切片与索引,按岗位与业务线做权限隔离,操作岗与关务岗账号一人一号;字段提取与齐备性比对在本地完成,箱号、封号、提单号等精确项走关键词与规则通道,语义检索只用于相似品名与编号的候选定位。若采用混合方式,仅允许脱敏后的最小片段经审批用于外部模型问答,并保留审批与调用记录;知识库与检查表配置始终留在本地。
数据流与边界
单证入库:单证只读入库,登记票号、业务线与版本关系;解析切片:隔离空间解析表格结构,保留页码与字段位置;字段提取:按模板抽取字段并附原文定位,缺失项标出;清单比对:比对齐备性检查表与同票多份单证的记载差异;人工核对:操作岗核对字段,关务岗确认申报口径;留痕交接:确认人、时间与版本留存,生成交接清单
交付物
字段模板与映射表(表格):每类单证的抽取字段、字段来源位置与精确匹配规则;齐备性检查表配置(配置):按业务类型维护的资料清单、必备项与缺失判定规则;抽取与比对评测记录(报告):测试集构成、字段命中与缺失项判定情况、未达项归因;待确认清单模板(模板):缺失项、冲突项、责任岗位与确认状态字段;操作规范与复核规则(文档):核对节点、责任岗位、留痕要求与转人工条件;验收脚本与测试用例(脚本):字段定位、权限、日志与比对规则的可复跑检查项
上线节奏
第 1—2 周:资料边界与岗位权限确认,梳理现行齐备性检查表与字段口径;第 3—4 周:用脱敏样本调优字段提取与比对规则,建立测试集与评测口径;第 5—7 周:单证量稳定的操作组接入,跑通提取、比对与核对流程并培训;第 8 周起:按评测结果与核对返工情况决定扩围的票型与业务线
人工复核点
字段提取结果 / 操作岗 / 箱号、封号、提单号、件重尺与金额逐项与原文核对;齐备性核对结论 / 操作岗 / 缺失项与待确认项逐条确认后方可进入下一环节;申报口径与归类 / 关务人员 / 申报内容与许可要件由关务岗确认,系统输出不作申报依据;单证外发 / 数据与合规负责人 / 新增外发场景或数据种类须书面审批;清单与模板更新 / 操作主管 / 齐备性检查表与字段模板变更时同步修订并留版本
风险控制
字段错误被带入申报:齐备性核对只输出缺失项与待确认清单,提交前由操作岗与关务岗逐项复核;归类或申报口径被系统输出替代:系统不产出归类与申报结论,只列候选与出处,口径由关务岗确认;客户与货物信息外发:默认禁止;确需外发仅发送脱敏最小片段并保留审批与日志记录;使用过期检查表导致漏项:齐备性检查表与字段模板按月核对,变更留版本,过期条目停用
合规依据
中华人民共和国海关法:如实申报的责任由收发货人及其委托方承担,系统仅辅助列出字段、缺失项与出处,申报内容由关务岗逐项确认;中华人民共和国数据安全法:建立全流程数据安全管理制度并采取必要技术措施,单证处理、导出与权限变更行为留痕
← 返回交通物流与运输 估算投入区间 预约 30 分钟需求梳理

先做一次 30 分钟的需求梳理

说出你的行业、数据边界与预算区间,我们在 1 个工作日内给出可验证的下一步。