OnvergeAi 临界AI
INDUSTRIES · OnvergeAi

制药大模型落地

面向制药与生物工程企业,提供公开文献检索、GMP与申报资料核对、研发文档整理辅助:先分离公开文献与内部研发工艺资料,输出仅作底稿,判断与放行由研发、QA与注册责任人负责。

制药与生物工程:我们能做什么

制药与生物工程的核心资产是未公开的研发数据与工艺参数:化合物与实验记录、工艺放大参数、注册申报资料、GMP 批记录与偏差调查,任何外发都会直接影响知识产权与合规地位;与此同时,公开文献与专利检索、药政问答、文件核对的工作量巨大,且高度依赖个人经验。落地顺序是:先把公开文献与内部研发、工艺资料两类边界分开,再做文献检索与文件核对的试点,最后扩到申报资料辅助。最容易踩的坑,是没有把研发数据与生产质量体系(GMP)两类数据分开管理,用一套权限打穿全部资料,导致越权访问与误外发无法界定,审计与监管问询时拿不出可交代的材料。

试点包
制药试点包(8—12 周):第 1—2 周完成资料分类登记与权限矩阵设计,把公开文献与内部研发、工艺资料分库分权;第 3—4 周用脱敏样本做文献检索与文件核对评测,建立命中、引用正确与拒答口径;第 5—8 周接入一个业务组(建议注册或 QA 中任务稳定的岗位);第 9 周起按评测结果与权限决定扩围。交付边界清单、权限矩阵、评测记录与操作规范。
推荐部署
纯私有化;混合部署;知识库本地化 + 外部模型
内容复核
每 90 天复核 · 证据等级 B
痛点

这个行业最难的地方

行业痛点不是形容词,而是可以对应到具体动作与责任人的问题项。

研发数据与工艺参数属未公开资产
一次误外发即可能损害知识产权与后续申报地位,且难以界定责任
GMP 批记录、偏差与变更文件量大且格式不一
完整性与条款核对占用 QA 大量时间,漏项往往在审批环节才被发现并返工
文献、专利与药政指南来源分散、口径不一
检索重复投入,法规变化与竞争情报跟踪不及时
注册申报资料条目繁多、结构固定
目录整理与既往问答翻找耗时,影响申报准备节奏
研发数据与生产质量数据混在同一套权限下
越权访问与误外发无法界定,审计与监管问询时缺少可交代的材料
任务

典型任务

这些任务是可以被系统辅助的范围;每项都对应人工复核点,不替代专业判断。

公开文献与专利检索

检索公开文献、专利与行业指南,输出附来源定位的摘要与竞争情报清单,只处理公开来源

研发与工艺资料内部检索

在隔离环境内对化合物与实验记录、工艺放大参数做检索与比对,默认不外发

GMP 文件与批记录核对

核对批记录、偏差与变更文件的完整性、版本与条款一致性,输出差异与漏项清单

注册申报资料目录整理

按申报结构整理目录与条目,输出缺项与待确认清单,不生成最终申报文本

药政问答与法规条款检索

检索既往问答与法规条款,输出附官方来源与时效标注的问答清单供注册岗判断

内部 SOP 与培训材料问答

面向内部规范与操作规程的问答,答案附条款定位,由质量部门确认后使用

能力边界:我们不做什么

不生成最终申报文本,不作审批结论与放行决定;研究与生产质量的判断权、签批权与放行权由研发、QA 与注册责任人行使并在系统中留痕。不做研发数据、工艺参数与批记录原文的公网外发与训练;不把公开文献检索结果直接作为专利布局或侵权判断的结论使用。不把私有化部署与等保定级当作合规结论,相关结论以主管部门与测评机构为准。系统输出仅为工作底稿与待确认清单。

风险与禁止事项:研发数据与工艺参数外发:默认禁止;确需外部模型参与时仅发送脱敏后的最小片段,并保留审批与日志记录;研发资料与 GMP 资料同库同权:按资料类别分库分权,检索前执行权限过滤,跨库访问单独授权;文献检索结果被当作知识产权结论:输出定位为检索底稿,专利与侵权判断由知识产权岗作出;文件核对结果被直接用于放行:差异与漏项清单仅为底稿,判定与放行以 QA 审批记录为准;
01

为什么使用本地大模型

制药与生物工程企业最常问的五件事:文献专利检索要占多少人力、批记录核对会不会漏、申报资料整理多快、研发数据会不会误外发、检查能不能交代。逐条对照如下。

你最关心的采用之后的变化可参照的量级(口径)
省人工:公开文献、专利与指南的检索与摘要现在多部门重复检索、重复做摘要;改为统一检索入口 + 来源定位 + 竞争情报清单,只处理公开来源。口径:同一批检索任务的耗时;经验量级:检索与整理工时降至 30%—50%(以试点实测为准)。
省时间:GMP 批记录、偏差与变更文件的核对现在靠人工通读比对,条款定位要翻页;改为按核对清单输出条款定位与差异候选,QA 逐项确认。口径:单批文件的核对周期与漏项数;经验量级:核对周期缩短约 1/3—1/2(以试点实测为准)。
提准确:文件核对不漏项现在偏差与变更文件依赖经验判断重点;改为强制输出漏项与差异候选清单,把遗漏在 QA 确认前暴露。口径:复核阶段发现的漏项数与其被发现的时间点;经验量级:漏项在复核前暴露比例明显提升(以试点实测为准)。
提效率:注册申报目录与药政问答现在申报资料目录与既往问答翻找占用注册岗时间;改为目录整理与法规条款检索形成待确认清单。口径:单套申报资料的目录整理工时;经验量级:整理工时降低 40%—60%(以试点实测为准)。
省成本:研发数据边界的隐性风险成本现在资料边界不清,一次误发即影响知识产权;改为分库分权、外发审批与日志留痕,边界可解释。口径:外发审批留痕完整率、越权访问事件数(目标为零容忍并逐条复盘)。
风险可控:检查与审计问询现在难说明「资料存放在哪里、谁看过」;改为边界清单、权限矩阵、日志策略与复核记录四类材料齐备。口径:四类材料完成度与留痕完整性检查项通过率。

※ 表中「经验量级」为同类项目的区间值,用于说明改善方向,不是效果承诺;实际幅度取决于资料完整度、流程配合与试点范围,以试点评测结论与书面合同为准。

02

行业内容体系

本行业的内容体系由六层构成:资料层定边界,知识层定可用,检索层定质量,生成层定底稿,复核层定责任,运行层定长期可用。

资料层:三类资料分治

公开文献、专利与行业指南(可入库)、内部研发与工艺资料(隔离)、GMP 批记录与质量文件(受控)。三类资料的处理方式、可见范围与保留期必须分别定义。

责任:研发负责人 + QA

知识层:可检索的边界

什么能进索引、什么只做只读引用、什么一律不进系统,逐类登记;索引与原文分离,支持按权限过滤检索范围。

交付:数据目录 + 权限矩阵

检索层:来源可回溯

检索结果附来源与文件定位(文件、页码、条款);化合物编号、专利号与法规条款号类查询加强关键词通道。

交付:检索评测记录

生成层:清单而非结论

只输出摘要、差异清单与待确认项,保留引用片段;系统不产出审批、放行与申报口径类结论。

交付:输出规范

复核层:判断归属岗位

文献结论、文件差异、注册口径三类节点由对应岗位确认,复核痕迹与版本留存,可追溯哪一版由谁确认。

机制:复核记录

运行层:日志与审计

记录检索、查看、导出与权限变更行为;日志范围最小必要,保留期按企业制度与合同约定执行。

机制:日志与审计
03

场景矩阵

三个典型场景的数据敏感度、自动化程度与人工介入强度不同,落地时按此顺序推进:先公开来源,再受控文件,最后申报辅助。

场景业务任务与自动化边界人工复核角色
文献与专利检索辅助公开文献、专利与行业指南的检索、摘要与竞争情报清单;自动化到“列出候选与出处”为止,只处理公开来源,内部研发数据单独隔离。研发岗 + 知识产权岗(结论与布局判断)
GMP 文件与批记录核对批记录、偏差与变更文件的完整性核对、条款定位与差异清单;输出漏项与差异候选,不判定偏差性质与是否放行。QA(判定、签批与放行决定)
注册申报与药政问答申报资料目录整理、既往问答与法规条款检索;输出目录与缺项清单,不生成最终申报文本。注册负责人(申报口径与提交前确认)
04

能力底座

制药与生物工程场景对“可核对、可隔离”的要求高于对“聪明”的要求,能力底座围绕这一点构建。

结构化解析与定位

PDF、扫描件、Word 与表格版面的解析策略,保留页码、条款与表格结构,为引用定位提供锚点。

实现:解析与切片

编号与术语精确检索

对化合物编号、专利号、法规条款号等精确匹配需求加强关键词通道,避免纯语义检索漏掉精确项。

实现:混合检索

多库隔离与分级授权

按资料类别划分索引与存储,检索前执行权限过滤,跨库访问单独授权并留痕。

实现:权限过滤

脱敏与最小片段

需要外部模型参与时,仅发送脱敏后的最小片段,并保留审批与外发记录。

实现:脱敏与审批

版本与时效标注

法规、指南与内部文件标注版本与生效状态,避免引用已废止或尚未生效的条款。

机制:版本台账

输出标识与规范

对生成内容按规范做标识,明确“辅助生成、需人工确认”的使用范围。

交付:使用规范
05

工程实现

制药与生物工程试点按 8—12 周推进:先做资料分类分离,再建评测口径,先单业务组跑通完整流程,再按结果扩围。

  1. 1

    第 1—2 周:资料分类与权限设计

    盘点资料类型与责任人,分离公开文献与内部研发、工艺资料;设计角色权限与账号隔离规则。

    交付:边界清单 + 权限矩阵
  2. 2

    第 3—4 周:脱敏样本与评测口径

    用小范围样本验证解析与检索质量,建立命中、引用正确与拒答的评测口径与测试集。

    交付:评测记录
  3. 3

    第 5—8 周:单业务组试点

    选定注册或 QA 中任务稳定的岗位接入,按复核节点跑通文献检索与文件核对流程。

    交付:操作规范 + 培训
  4. 4

    第 9—10 周:效果与权限复盘

    按评测口径复盘结果,分析未达项归因(解析、切片、检索、数据或使用方式),修正配置。

    交付:复盘报告
  5. 5

    第 11—12 周:扩围与制度化

    按效果与权限决定是否扩到申报资料辅助;把边界清单、复核规则与日志策略纳入企业制度。

    交付:制度建议

※ 周期受资料结构、扫描件比例与审批节奏影响;批记录电子化程度低或审批链较长的团队会延长。

06

治理保障

本行业项目的治理核心是资料分类分级的工程化:把研发数据与 GMP 生产质量数据的处理要求翻译成可执行、可留痕的系统规则。

资料分类分级
按公开文献、内部研发与工艺、生产质量三类分级登记,逐类确定可见范围、处理方式与保留期。依据:数据分类分级保护要求
研发与质量体系分权
研发资料与 GMP 资料分库分权管理,一套权限不打穿全部资料;跨库访问需单独授权并留痕。机制:隔离与权限过滤
对外使用人工确认
涉及研发、生产质量与申报的输出,在对外提交或发布前由对应责任人确认并留存记录。机制:复核记录
日志最小必要
记录必要字段与操作行为,不落全文日志;日志保留期按企业制度与合同约定。机制:日志策略
部署边界不等于合规结论
私有化是控制边界,等保是建设与评估框架;相关结论以主管部门与测评机构为准。说明:边界声明
内容复核周期
行业页所述方法、边界与法规对应动作每 90 天复核一次,法规更新时同步修订。周期:90 天
退出与处置
项目终止时按约定返还或删除资料、索引与衍生文件,出具处置记录。机制:退出与销毁
07

解决什么问题与价值

本行业落地大模型的价值不在“自动化出结论”,而在把检索、整理与核对的时间释放出来,并把可核验性与资料边界做实。

检索与整理耗时下降
现状:文献、专利与法规检索重复投入。动作:统一检索入口与来源定位,效果可用同一批任务的耗时对比测量。
文件核对不漏项
现状:批记录与偏差文件依赖人工通读。动作:按核对清单输出差异与漏项候选,由 QA 逐项确认。
研发数据不被误外发
现状:资料边界不清,一次误发即影响知识产权。动作:分库分权、外发审批与日志留痕,边界可解释。
申报资料整理提速
现状:申报目录与既往问答翻找占用注册岗时间。动作:目录整理与条款检索形成待确认清单。
合规动作可交代
现状:无法说明资料存放在哪里、谁看过。动作:边界清单、权限矩阵、日志策略与复核记录四类材料齐备。
投入分阶段可控
现状:一次大投入风险高。动作:先单业务组试点并预定义评测口径与退出条件,未达条件不扩围。

※ 以上为行业落地方法与边界说明,不构成对具体项目效果的承诺;实际范围以书面方案与合同为准。

SCENARIOS

典型应用场景(3)

每个场景给出典型任务、客户痛点、适用前提、人工复核点与能力边界;点击进入完整场景分析(含输入输出、架构与工程实现、治理保障与投入节奏)。

01

文献与专利检索辅助

首期主场景

把公开文献、专利与行业指南变成可回溯的检索清单:统一入口检索、按主题汇总摘要、输出竞争情报候选清单,每条结论附来源与文件定位。系统只处理公开来源,内部研发数据与工艺参数在独立空间中存放,不进入同一索引。检索结果仅为检索底稿,专利布局、侵权判断与申请策略由研发或知识产权岗核对原文后作出,系统不给出法律或商业结论。

典型任务
  • · 按主题、靶点或化合物名称检索期刊与会议公开文献,输出附来源与页码的摘要候选清单:公开文献检索与摘要
  • · 按关键词与分类号检索公开专利,整理申请人、法律状态等字段,输出待确认的同族候选清单:专利检索与同族整理
  • · 跟踪公开指南与法规文本更新,标注版本与生效状态,输出变化点清单供人工确认时效:行业指南与法规跟踪
  • · 按公开来源汇总企业公开进展信息,逐条保留出处,作为人工复核用的线索清单:竞争情报候选清单
  • · 对化合物编号、专利号与分类号等精确项加强关键词检索,避免纯语义检索漏掉精确项:编号与术语精确匹配
  • · 记录检索式、执行时间与结果版本,形成可复跑的检索记录,便于后续复核与更新:检索结论留痕
客户痛点
  • · 公开来源分散、口径不一(同一主题需在多个数据库重复检索,条目与出处难以对齐)
  • · 精确编号易被语义检索漏掉(化合物编号与专利号漏检需人工二次翻查,影响覆盖面判断)
  • · 法规与指南更新快(引用到已废止或尚未生效的版本,需在复核阶段返工)
  • · 检索结果须与内部研发资料分开(混库存放会导致越权访问与误外发无法界定)
适用前提
  • · 明确检索范围限于公开文献、公开专利与公开指南,内部研发与工艺资料不进入本场景索引(确认只处理公开来源)
  • · 按公开来源与内部资料划分索引,检索前执行权限过滤,跨库访问单独授权(完成资料分库与权限设计)
  • · 明确知识产权岗或研发岗对摘要、引用位置与检索覆盖面负责(指定复核责任岗)
  • · 登记检索来源、访问时间与版本信息,便于后续核对时效(建立来源与版本台账)
人工复核点(不可省略)
  • · 检索范围与来源 / 知识产权岗 / 确认检索式、数据库与时间范围,判断覆盖面是否满足任务需要
  • · 摘要与原文引用 / 研发岗 / 逐条核对原文位置与技术表述,未核对内容不得对外使用
  • · 专利相关判断 / 知识产权岗 / 专利布局、侵权与申请策略由知识产权岗作出,系统不作为结论依据
  • · 法规与指南时效 / 注册负责人 / 确认引用条款的版本与生效状态后才可使用
  • · 对外使用 / 业务负责人 / 对外提交或发布前由责任人确认并留存记录
能力边界:不提供专利侵权、可专利性与自由实施结论;不代检索机构出具检索报告;不生成专利申请文件或技术交底书定稿;不检索、不引用内部研发与工艺资料作为公开来源;检索结果不得直接用于申报或对外发布。上述判断由研发与知识产权岗作出并留痕。
查看完整场景分析 →
02

GMP 文件与批记录核对

把批记录、偏差与变更文件变成可回溯的完整性核对结果:按检查表逐项比对文件齐备性、填写项与版本一致性,输出漏项与差异候选清单,并给出条款定位。系统做的是整理、定位与比对,不做偏差性质判定、不签署、不放行。每一条差异必须能回到原文位置,由 QA 逐项确认后进入企业既有的偏差与变更流程。

典型任务
  • · 按检查表核对批记录的页序、填写项与签项是否齐备,输出漏项与缺页候选清单:批记录完整性核对
  • · 核对偏差描述、调查记录与纠正预防措施是否成套,输出未闭环条目候选:偏差文件核对
  • · 比对新旧版本变更文件的条款差异,标注变更点与受影响的关联文件:变更文件比对
  • · 按文件编号、批号或条款号定位到具体位置,返回文件、页码与条款:条款与文件定位
  • · 核对同一文件在不同记录中的版本引用是否一致,逐条列出不一致项:版本一致性核对
  • · 记录核对清单、比对依据与确认人,形成可按批次与文件类型追溯的核对记录:核对结果留痕
客户痛点
  • · 批记录与偏差文件量大、格式不一(人工通读占用 QA 大量时间,漏项常在审批环节才被发现并返工)
  • · 条款与文件引用分散(定位一处条款需翻多个文件,核对效率低且易看错版本)
  • · 版本与变更关系复杂(引用旧版本或漏改关联文件的风险需人工反复确认)
  • · 核对过程需可追溯(缺少留痕时无法说明核对依据与确认人)
适用前提
  • · 由企业按权限提供批记录与质量文件副本,来源与版本可确认(文件以受控方式提供)
  • · 确定纳入核对的文件类型与期间,扫描件比例与清晰度在可处理范围内(明确可核对范围)
  • · 核对项、判定用语与差异分级口径经 QA 确认后使用(建立检查表与口径)
  • · 明确 QA 对差异判定、纠正预防措施与放行决定负责(指定复核与签批责任)
人工复核点(不可省略)
  • · 文件范围与版本 / QA / 确认纳入核对的文件、期间与受控版本
  • · 检查表与判定用语 / QA / 核对项与差异分级口径由 QA 确认后方可使用
  • · 差异与漏项清单 / QA / 逐项与原始批记录比对,是否构成偏差由 QA 判定
  • · 变更文件关联影响 / QA / 受影响文件的处理按企业变更控制流程决定
  • · 归档与放行 / QA / 归档与放行决定不由系统作出,按企业质量管理体系执行
能力边界:不判定偏差性质与等级;不签署批记录、不做放行决定;不替代企业既有的偏差与变更审批流程;不生成加盖签章的质量文件定稿;不输出可直接归档的结论性文本。所有判定与签批由 QA 按企业质量管理体系作出并留痕。
查看完整场景分析 →
03

注册申报与药政问答

把申报资料与药政信息变成可回溯的目录、缺项清单与问答记录:按申报结构整理资料目录与条目,检索既往问答与法规条款并标注官方来源与时效。系统做的是整理、检索与定位,不生成最终申报文本、不作申报口径结论。目录、缺项与问答结论由注册负责人确认,提交与监管沟通由企业按既定流程完成并留痕,系统不代为沟通。

典型任务
  • · 按申报结构与模块整理资料目录,登记条目、版本与责任部门,输出待确认清单:申报资料目录整理
  • · 对照资料清单逐项核对齐备性,输出缺项、过期版本与待补材料候选清单:缺项与待补清单
  • · 检索既往问答与监管沟通记录,按主题归集并逐条标注来源与获取时间:既往问答检索
  • · 检索法规与指导原则条款并标注版本与生效状态,返回条款定位供人工判断:法规条款检索
  • · 核对同一事项在不同资料中的表述与口径是否一致,逐条列出不一致项:术语与口径核对
  • · 记录检索式、引用来源与确认人,形成可追溯、可按周期复跑的问答与检索记录:检索与问答留痕
客户痛点
  • · 申报资料条目多、结构固定(目录整理与齐备性核对耗时,缺项常在提交前才被发现)
  • · 既往问答分散在多个渠道(重复查询历史问答,同一事项的回答口径不一致)
  • · 法规与指导原则更新快(引用过时版本需返工,影响申报准备节奏)
  • · 申报口径判断责任集中(缺少可回溯的检索与确认记录时,责任界定不清晰)
适用前提
  • · 由企业确认可入库的申报资料范围与版本,按资料类别划分授权(明确资料使用范围)
  • · 明确申报口径、目录结构与缺项判断由注册负责人确认(指定注册负责人)
  • · 法规、指导原则与问答来源限于官方渠道,登记访问时间与版本(建立官方来源清单)
  • · 输出限定为目录、清单与检索记录,最终申报文本由企业按监管要求编制(约定不生成对外文本)
人工复核点(不可省略)
  • · 资料范围与版本 / 注册负责人 / 确认纳入整理的资料类别、项目与版本
  • · 目录结构与条目 / 注册负责人 / 目录结构与条目归属由注册负责人确认
  • · 缺项与待补清单 / 注册负责人 / 缺项判断与补交顺序由注册负责人决定
  • · 药政问答与条款引用 / 注册负责人 / 引用须来自官方来源并标注时效,结论由注册负责人判断
  • · 提交前确认 / 注册负责人 / 任何对外提交前由注册负责人确认,系统不生成最终申报文本
能力边界:不生成最终申报文本与报送材料;不判断申报可行性、审评结论或获批前景;不代为与监管机构沟通;不引用非官方来源作为法规依据;不把目录与缺项清单直接用于提交。所有申报口径与提交前确认由注册负责人负责,提交与监管沟通按企业流程执行。
查看完整场景分析 →

合规与监管要求 → 项目动作

法规要求不直接变成合规结论,而是转成可以勾选、可以取证的工程动作与责任人。

法规与监管要求条款要点对应项目动作
中华人民共和国药品管理法 药品上市许可持有人依法对药品的非临床研究、临床试验、生产经营、上市后研究、不良反应监测及报告与处理等承担责任。
官方来源
持有人对非临床研究、临床试验、生产经营与上市后管理承担责任,全过程信息应真实、准确、完整、可追溯;对应动作:资料分类登记、研发与 GMP 资料分离授权、导出行为留痕、对外使用人工确认
药品生产质量管理规范 企业应当建立药品质量管理体系。该体系应当涵盖影响药品质量的所有因素。
官方来源
企业应建立药品质量管理体系,覆盖影响药品质量的所有因素,批记录、偏差与变更须完整记录并按规定审批;对应动作:文件完整性与条款定位清单、差异与漏项候选输出、判定与放行由 QA 完成
中华人民共和国数据安全法 国家建立数据分类分级保护制度,对数据实行分类分级保护。
官方来源
国家建立数据分类分级保护制度;对应动作:把公开文献、内部研发与工艺资料、生产质量资料三类分级登记,权限矩阵与外发审批写入操作规范

推荐部署方案

  • · 纯私有化:研发数据、工艺参数与批记录默认不外发,模型、知识库、网关与日志全部在指定环境内
  • · 混合部署:按资料类别分流:内部研发与 GMP 资料留在本地,公开文献类检索请求可按审批使用外部模型
  • · 知识库本地化 + 外部模型:本地算力不足时的过渡方案:向量库与权限在本地,仅脱敏后的最小片段的按审批外发
部署说明见「部署架构」栏目,方案边界需逐项书面确认

人工复核点(不可省略)

  • · 公开文献与专利摘要 · 知识产权岗:摘要与检索结果须回到原文核对,专利布局与涉外申请判断由知识产权岗作出
  • · GMP 文件差异与漏项清单 · QA:清单仅为工作底稿,是否构成偏差与如何处置由 QA 判定
  • · 批记录完整性核对结果 · QA:核对结果须与原始批记录逐项比对后才可归档,放行决定不由系统作出
  • · 注册资料目录与缺项清单 · 注册负责人:目录结构、缺项与申报口径由注册负责人确认
  • · 药政问答与条款引用 · 注册负责人:引用须来自官方来源并标注时效,结论由注册负责人判断
  • · 研发与工艺资料入库范围 · 研发负责人:新增资料类型或新开跨库权限须书面确认
  • · 对外输出定稿 · 业务负责人:任何对外提交或发布前由对应责任人确认并留存记录

先做一次 30 分钟的需求梳理

说出你的行业、数据边界与预算区间,我们在 1 个工作日内给出可验证的下一步。