不良事件自动录入:多渠道解析+MedDRA编码
每天早上,药物警戒(PV)团队的邮箱里可能躺着几十封来自呼叫中心、患者支持项目、电商评论、医学问询的邮件,其中夹杂着电话录音转写、截图、甚至一段微信聊天记录。这些信息里藏着疑似不良事件(AE),但格式五花八门,需要人工逐条阅读、提取字段、再手动编码MedDRA。据行业调研,PV专员约60%的时间消耗在病例录入与编码等重复性工作上,真正用于医学评估的时间被严重挤压。本文围绕“不良事件自动录入:多渠道解析+MedDRA编码”这一主题,拆解如何用AI智能体把“人找信息”变成“信息找人”。
对于企业管理者而言,这不仅是效率问题,更关系到合规风险和患者安全。NMPA《药物警戒质量管理规范》要求持有人对不良反应报告做到及时、准确、可追溯;ICH E2B(R3)则对个例安全性报告(ICSR)的数据字段和传输格式提出了严格标准。传统人工模式越来越难同时满足“快”和“准”。下面从痛点、能力、落地路径和实施建议四个层面展开。
一、不良事件录入为何成为药物警戒的“隐形瓶颈”
1.1 渠道碎片化:信息藏在录音、邮件和评论里
药物警戒的信息来源从来不是单一渠道。呼叫中心有通话录音,医学问询有邮件,患者支持项目有随访表,电商平台有用户评论,文献数据库还有大量病例报告。这些渠道共同构成了不良事件的“原始素材库”,但格式差异极大。
- 来源多样:呼叫中心、医学问询、患者支持项目、文献数据库、社交媒体、电商评论、门店反馈等,任何触点都可能产生疑似不良事件。
- 格式非结构化:电话录音需要转写,PDF和图片需要OCR,聊天记录需要清洗,患者口语化描述需要语义理解。
- 时效要求高:严重不良事件通常需要在24小时内上报,人工逐条处理容易遗漏或延迟。
面对这些碎片化渠道,实在Agent可以通过多渠道解析能力,把录音、邮件、图片、评论等统一转化为可处理的结构化输入,为后续自动录入打下基础。
1.2 MedDRA编码:专业门槛与一致性难题
MedDRA(监管活动医学词典)是药物警戒领域的国际标准术语集。它的层级结构从LLT(低位语)到PT(首选语),再到HLT、HLGT,最后归入SOC(系统器官分类)。编码员需要根据事件描述选择最合适的LLT或PT,这既需要医学知识,也需要对词典结构的熟悉。
- 层级复杂:同一个事件在不同层级有不同表述,选择哪一层直接影响信号检测和统计分析。
- 一致性挑战:不同编码员对同一事件可能选择不同LLT,导致数据离散,统计信号偏移。
- 版本更新频繁:MedDRA每年3月和9月更新,企业需要持续维护同义词库和映射规则。
实在Agent采用“大模型+小模型”双轨制,大模型负责理解上下文和语义,小模型与规则引擎负责精确匹配MedDRA词典,既保证效率又提升编码一致性。
1.3 合规审计:每一步都要可追溯
药物警戒是强监管领域。GxP、21 CFR Part 11、ICH E2B(R3)以及NMPA《药物警戒质量管理规范》都对数据完整性、审计追踪和权限管理提出了明确要求。
- 审计追踪:谁在什么时间修改了哪个字段,必须有完整日志。
- 权限分级:不同角色只能访问授权范围内的病例数据。
- 数据安全:患者隐私数据不能出域,信创环境下的国产化适配也成为部分企业的硬性要求。
实在Agent提供全链路日志审计、RBAC权限模型和信创终端适配,从芯片到代码支持国产化环境,满足医药行业对合规与安全的严苛要求。
二、不良事件自动录入的三大核心能力
2.1 多渠道解析:把非结构化信息“归一化”
自动录入的第一步,是让机器“看懂”不同渠道的信息。这背后需要语音识别、OCR、自然语言处理等多种技术协同。
- 语音转写与说话人分离:自动区分患者、家属、医生等不同角色,保留对话上下文。
- OCR与文档解析:支持PDF、扫描件、图片、表格等多种格式,提取文字和关键区域。
- 多语言与口语化理解:识别“吃了药后身上起红点”这类非标准表达,并映射到医学概念。
- 社交媒体监听:抓取公开评论、帖子中的疑似不良事件,扩大信号发现范围。
实在Agent的多渠道解析引擎可以接入电话系统、邮件网关、企业微信、客服工单等,把不同来源的信息统一排队、去重、合并,避免重复报告。
2.2 智能抽取与结构化:从“故事”到“字段”
一份通话记录或一封邮件,本质上是一个“故事”。自动录入需要把这个故事拆解成ICSR所需的标准化字段。
- 关键字段:患者信息、事件描述、怀疑药物、合并用药、发生时间、严重性、报告者类型等。
- 大模型语义抽取:理解上下文,补全隐含信息,例如从“上周三开始发烧”推断具体日期。
- 小模型精准校验:对日期、剂量、单位等做标准化和合理性检查。
- 缺失字段追问:自动生成随访任务或回问模板,提醒报告者补充信息。
通过实在Agent的IDP(智能文档处理)引擎,可以将一份通话记录自动拆解为ICSR所需字段,并标记每个字段的置信度,方便人工优先复核高风险项。
2.3 MedDRA编码:大模型+小模型双轨制
MedDRA编码是不良事件自动录入中最具专业门槛的环节。单纯依赖大模型可能出现“看似合理但编码不准”的问题;单纯依赖词典匹配又难以处理口语化、多义词和上下文依赖。
- 大模型生成候选:根据事件描述输出多个LLT/PT候选,覆盖不同语义可能。
- 小模型精确匹配:基于MedDRA词典、企业自定义同义词库做排序和消歧。
- 置信度分级:高置信度自动编码,低置信度转人工复核。
- 反馈学习:人工修正结果回流,持续优化模型和词典。
实在Agent在类似审单场景中已验证“大模型+小模型”双轨制的价值,初审替代率可达66%以上,准确率提升至99.2%。在不良事件录入场景,同一套架构可复用,显著降低编码门槛和人为偏差。
2.4 自动录入与系统回写
编码完成后,数据需要写回安全数据库,并触发后续流程。这一步决定了自动录入能否真正闭环。
- 对接安全数据库:Argus、ARISg或企业自研PV系统,通过API或RPA方式集成。
- 自动填写表单:按E2B(R3)字段映射,自动填充ICSR表单。
- 触发后续流程:随访任务、信号检测、定期安全性更新报告(PSUR)等。
实在Agent以数字员工形式嵌入现有流程,7×24小时不间断处理,新报告到达后分钟级完成解析、编码与录入,让PV团队把精力集中在医学判断和风险控制上。
三、实在Agent如何落地不良事件自动录入
3.1 五步闭环流程
将上述能力组合起来,就形成了一条从渠道到数据库的自动化流水线。
- 渠道接入:电话、邮件、工单、社交平台等多源信息统一接入。
- 解析抽取:语音转写、OCR、NLP,把非结构化内容转为文本和字段。
- MedDRA编码:双轨制生成候选编码,小模型校验并排序。
- 自动录入:写入安全数据库,生成完整审计日志。
- 人工确认:高严重性、低置信度病例转医学审核,形成人机协同。
3.2 与现有系统集成
企业通常已有PV系统、CRM、呼叫中心等基础设施,自动录入方案需要“嵌入式”落地,而非推倒重来。
- API优先,RPA补充:有接口的系统走API,没有接口的通过RPA模拟人工操作。
- 权限与服务管理:基于RBAC模型配置角色权限,确保数据最小化访问。
- 信创适配:支持统信、麒麟、鸿蒙等国产操作系统,满足合规要求。
3.3 人机协同与质量校验
自动化不等于无人化。药物警戒的最终责任仍在医学审核人员身上,因此需要设计合理的人机协同机制。
- 置信度阈值可配置:企业可以根据自身风险偏好设置自动通过、人工复核的阈值。
- 高严重性自动升级:死亡、危及生命等严重事件优先转人工。
- 人工反馈闭环:每一次人工修正都成为模型优化的训练信号。
四、场景成效:从“人找信息”到“信息找人”
4.1 某医药企业应用片段
某跨国药企的中国区PV团队,此前每天需要处理来自呼叫中心、邮件和患者支持项目的数百条疑似不良事件信息。录入和编码工作分散在多人手中,平均每例耗时15分钟以上,且编码一致性难以保证。
引入实在Agent后,团队将呼叫中心录音、邮件和工单统一接入自动录入流程。系统自动完成语音转写、字段抽取、MedDRA编码和ICSR表单回写,PV专员只需复核低置信度和严重病例。单例处理时间从15分钟降至3分钟左右,编码一致性明显提升,严重不良事件的24小时上报率也得到改善。
4.2 可量化的价值
从类似场景的实践来看,自动录入带来的价值集中在四个方面:
- 效率提升:数字员工7×24小时作业,人工负荷降低超60%。
- 准确率提升:双轨制编码减少人为偏差,整体准确率可达99%以上。
- 合规增强:全链路日志审计和权限管理,满足GxP和NMPA要求。
- 成本优化:项目投入通常在10个月左右收回,长期运维成本显著低于纯人工模式。
五、实施建议与常见误区
5.1 先试点高价值渠道
不建议一开始就全渠道铺开。可以先选择信息量大、格式相对统一的渠道,例如呼叫中心录音或患者支持项目邮件,快速验证效果后再扩展。
5.2 建立企业级MedDRA编码词典与反馈闭环
MedDRA标准词典之外,企业往往有自定义术语和产品特异性表达。需要建立企业级同义词库,并让人工修正结果持续回流,形成“越用越准”的正循环。
5.3 重视权限、审计与信创适配
药物警戒数据敏感度高,权限设计和审计追踪必须在项目初期就纳入规划。对于有国产化要求的企业,还需要确认方案是否支持信创终端和国产数据库。
结语:让PV团队回归医学判断
不良事件自动录入:多渠道解析+MedDRA编码,不是简单地把人工操作换成机器人,而是重构药物警戒的数据流水线。它把PV专员从重复的复制粘贴和编码查询中解放出来,让专业医学判断回归核心位置。随着监管要求趋严和报告量持续增长,越早构建自动化能力的企业,越能在合规与效率之间找到平衡。
常见问题解答
1. 自动录入能否保证MedDRA编码准确率?
不能承诺100%准确,但可以通过“大模型+小模型”双轨制把准确率提升到较高水平。大模型负责语义理解和候选生成,小模型负责词典匹配和消歧,低置信度结果转人工复核,整体准确率通常可达99%以上。
2. 多语言、手写材料如何处理?
多渠道解析引擎支持多语言语音转写和OCR识别,手写材料可通过图像增强和手写识别模型处理。对于识别不确定的内容,系统会标记置信度并提示人工确认。
3. 与现有安全数据库集成难度大吗?
取决于现有系统的开放程度。有API的系统优先通过API对接;没有API的系统可以通过RPA模拟人工操作,实现表单填写和数据回写。实在Agent支持多种集成方式,降低改造成本。
4. 数据安全与合规如何保障?
方案支持私有化部署、RBAC权限模型、全链路日志审计和信创终端适配。患者隐私数据可在企业内网闭环处理,满足GxP、21 CFR Part 11和NMPA相关要求。
5. 实施周期和投入产出如何?
试点渠道通常在数周内可上线,全渠道推广视系统复杂度而定。从类似场景看,项目投入约10个月可收回成本,长期来看,人工负荷降低、合规风险下降和报告时效提升带来的综合收益更为可观。



