临床电子病历自然言语处理中的应战与应对,首席AI迷信家这样说

图灵汇官网

随着医疗信息化的不断推进,医疗大数据在过去一段时间内吸引了医疗界、学术界、产业界以及政府机构的广泛关注。临床电子病历作为这一趋势的核心,成为众多专业人士眼中巨大的宝库。然而,尽管宝藏就在那里,通往宝藏的道路却充满坎坷,许多人在面对这一问题时感到束手无策。

为何会出现这种情况?数据封闭、数据孤岛、数据隐私和伦理问题等都是主要原因。本文主要探讨其中的技术挑战。

从技术角度来看,目前面临的最大难题在于海量的医疗数据难以被计算机有效处理。简单来说,这些以文本为主的电子病历虽然能够被专业人员读懂,但计算机却难以理解,因此也无法发挥其应有的计算功能,更谈不上在应用端展现其价值。

举例来说,如果我们想了解国内排名前十的肿瘤医院中没有家族病史的肺部恶性肿瘤患者总数,这个问题在数学上看似简单,但实际上即使这些医院提供了数据,也可能无法准确统计。因为家族病史通常记录在病历的自然语言文本中,让计算机识别这些信息需要耗费大量人力物力。

即便识别出这些信息,也还不够。如果计算机不了解“非小细胞肺癌”是肺部恶性肿瘤的一种,它仍然无法正确统计患者数量。这只是其中一个例子,实际上,在寻找数据宝藏的路上,隐藏着许多障碍,使得许多研究者误入歧途。

本文将详细讨论在临床电子病历的自然语言处理方面遇到的三大挑战,以及应对这些挑战的一些方法,分别是数据质量问题、数据结构化问题和数据标准化问题。这些问题几乎是所有试图挖掘医疗大数据价值的研究者必须面对的难关。

首先,我们来谈谈数据质量问题。临床电子病历的质量确实存在问题,如果不解决这些问题,后续的努力可能会白费。无论数据信息提取和标准化做得多么出色,无论构建出多么优秀的AI模型,如果原始数据有误,那么所有的模型和结论都会随之出错。

数据质量存在的问题包括但不限于:例如,如果发现一位男性的病历中诊断为卵巢癌,这样的数据显然不适合用于进一步的临床研究。再比如,病理报告中同一天检查的二十多个患者的生日全部相同,这显然是个巨大的巧合。如果发现肺炎患者缺少血常规检查结果,这样的数据也会导致错误结论的产生。

因此,在构建任何自然语言处理技术模型之前,首要任务是找到并解决这些问题。这些问题的共同特点是与正常的医学逻辑、信息技术逻辑和常识逻辑相悖。

虽然经验丰富的医生可以发现并判断这些问题,但在海量电子病历中依靠人工发现的方法并不现实。因此,自动化数据质量检测变得至关重要。为此,我们需要构建符号化的数据质量控制知识库,采用基于一阶逻辑的数理逻辑表达,结合概率分析。这需要解决的主要问题是数据质量控制规则的构建,包括人工定义与符号化、自动化规则挖掘和人工校验。

接下来是数据结构化问题。数据质量管理完成后,下一步是让数据变得可计算。这意味着要从电子病历的自然语言文本中提取所需的关键内容,如诊断名称、药物名称、用药剂量、肿瘤位置、肿瘤大小、手术名称等。

这涉及实体识别(NER)和关系分类的问题。虽然已有较为成熟的CNN+Bi-LSTM+CRF及其各种变种算法,加上BERT等技术,但单纯依赖这些模型并不能解决所有问题。在医疗信息处理领域,实体识别不仅依赖于文本中的词,还依赖于上下文信息。然而,医疗术语的歧义性较小,上下文信息相对较弱。因此,计算机更需要认识术语本身,而不是依赖上下文信息。

这就意味着,构建针对特定实体的词表变得更为重要。由于临床术语的使用并不规范,提前定义词表是一项艰巨的任务。因此,需要从海量医疗文本中挖掘所需的词表。词表的构建与实体识别相互依赖,需要通过大量文本数据迭代进行。

在临床电子病历的结构化过程中,实体识别只是第一步。还需要确定实体之间的关系,并进行医学逻辑推理,最终生成所需的字段。例如,乳腺癌患者的分期信息可能不在病历中明确写出,但可以通过病理报告和影像检查报告中的信息推断出。

因此,高质量的电子病历结构化不仅需要准确的实体识别,还需要关系判定和医学逻辑推理。端到端模型虽然可以实现较好的效果,但标注数据的成本较高,且存在“黑盒效应”,难以追踪错误来源。因此,建议结合基于词表构建和识别模型构建,通过关系分类的机器学习模型与规则模型混合的方式,以及医学逻辑知识库,完成高质量的电子病历结构化。

最后是数据标准化问题。信息提取和结构化完成后,数据的可计算性并未完全解决。下一个挑战是术语标准化,也称术语归一化。这里不讨论格式标准化问题,如时间日期和用药剂量单位的统一。重点讨论需要自然语言语义信息和知识能力解决的术语标准化问题。

例如,“双侧交感神经链切断术”在某些标准表中表示为“交感神经或神经节的切断术”。如果不将各种不同的表达方式归结到标准术语,就可能出现数据统计不准的情况。临床病历中术语表达不规范的现象十分普遍,这对术语标准化提出了巨大挑战。

解决这一问题需要充分利用医疗术语的字面信息,并构建标准术语的相关描述信息,用于计算其与非标准化临床用语之间的关系。这需要结合知识和特征,通过生成模型、翻译模型、规则体系和语义相似度计算等多种方法进行。术语标准化的另一个挑战是长尾问题,许多非标准术语出现次数较少,因此算法需要迭代进行。

除了上述挑战外,在具体实施临床电子病历处理任务时,还需要跨越其他陷阱。以下是几种常用且有效的机器学习框架,它们看似不起眼但非常重要,可以显著提升工作效率和效果。

  1. 自动学习:自动学习可以根据无标注数据的分布情况,结合已初步预训练的算法模型在新标注数据上的表现,动态决定下一步需要标注的样本。这在无监督学习和半监督学习框架下尤为重要。

  2. 迁移学习:迁移学习可以在已有大量标注数据的基础上,将训练好的模型迁移到只有少量标注数据的新场地。这对于跨医疗机构数据处理场景特别有用,可以大幅降低标注成本。

  3. 联邦学习:联邦学习可以在保护数据隐私和安全的前提下,实现模型在各医疗机构的分布式训练。这在处理高度敏感的医疗数据时尤为关键。

综上所述,大规模临床电子病历要真正发挥其价值,需要解决许多问题。数据质量管理、数据结构化信息提取和数据归一化标准化都是非常复杂的挑战。这些问题的解决单靠人工是无法大规模实现的,必须借助自然语言处理技术。这不仅需要自然语言处理算法和技术,还需要强大的医学背景知识。因此,采用知识工程与机器学习相结合的方法是必要的。

为了让更多研究者参与进来,我们组织了相关评测任务,开放了部分无敏感信息的人工改造模拟数据。这些评测任务将逐步逼近真实应用场景,推动基于真实世界数据的医学进步,实现绿色医疗。

闫峻,医渡云首席人工智能科学家。他曾任微软亚洲研究院高级研究员、哈佛大学医学院访问学者、多个国际期刊审稿人和顶级国际会议程序委员会委员。他拥有北京大学数学学院信息科学博士学位,曾在微软北京大学联合实验室担任副主任,并在中山大学和中国人民大学担任导师。加入医渡云后,闫峻专注于自然语言处理领域,积累了丰富的人工智能应用经验。

本文来源: 图灵汇 文章作者: 张琦