陈章,本科毕业于中国科学技术大学,获得香港中文大学生物信息硕士学位和宾夕法尼亚大学(UPenn)的生物信息博士学位。目前任职于哈佛大学附属医院Dana-Farber Cancer Institute,主要从事医疗大数据研究。他的研究方向涵盖利用统计和机器学习方法对基因组、医疗电子病历和图像数据进行建模和分析。
苏丽娟,浙江大学计算机科学与技术专业的博士,现任腾讯医疗AI研究员。曾任哈佛大学附属医院MGH的研究助理,参与国家重点基础研究发展计划,并担任美国脑科学基金会委员和波士顿智慧医疗研讨会委员。她的主要研究领域为基于人工智能和机器学习的医疗健康大数据挖掘和应用,并发表了多篇国际学术论文。
各位老师、朋友们,大家好!感谢主办方的邀请,我很高兴能有机会与大家分享我们的研究成果。我是陈章,目前在Dana-Farber Cancer Institute担任数据科学家,我们是哈佛大学的附属医院。今天有幸与来自腾讯AI医疗的苏丽娟博士共同分享我们的见解。
我们今天分享的主题是自然语言处理在医疗电子病历数据中的应用。由于时间限制,我们将重点放在电子病历、自然语言的基础知识及其具体应用上。对于技术细节,我们将只做简要介绍,有兴趣深入了解的朋友可以与我们联系交流。
希望今天的分享能够对各位老师有所帮助。
在开始分享之前,我想先简单介绍一下自己。我本科主修生物学,硕士和博士期间专注于生物信息学。毕业后,我在Thomas Jefferson University Hospital工作了两年,目前在Dana-Farber Cancer Institute担任数据科学家,主要研究方向包括生物医疗数据的分析、统计建模和机器学习算法开发等。我对基因组数据、电子病历数据和医学图像数据都有较为深入的了解。
此外,我也附上了我的Google Scholar链接,里面有我发表的文章。最后,附上了我的微信,方便大家有任何问题随时联系我。
今天的分享主要分为两部分。第一部分由我来为大家介绍电子病历数据和自然语言处理的基本概念,然后我会分享几个我在医院参与的课题,探讨自然语言处理如何解决一些医疗问题。因为我主要在美国医院工作,所以这部分将侧重于美国的医疗系统和数据应用。国内的医疗系统则由苏博士在第二部分详细讲解。
在开始之前,先简单介绍一下常见的医疗数据类型。根据我个人的经验和理解,常见的医疗数据可分为以下几类:
这些是根据我的经验总结的常见医疗数据类型。
接下来,我们重点讨论自然语言处理(NLP)。简单来说,NLP是指计算机处理、理解和生成人类语言的技术。
自然语言处理的应用范围非常广泛,包括但不限于:
在医疗数据中,存在大量非结构化的医疗文本数据,例如手术记录、检查记录和病程记录等。据估计,70%-90%的医疗数据信息包含在这些非结构化的文本数据中。这些信息如果能被有效提取和使用,将有助于疾病诊断和治疗,以及改善医疗服务的其他方面。
目前常用的机器学习算法无法直接处理非结构化的医疗文本数据,因此需要使用自然语言处理技术从非结构化的数据中提取信息,并将其转化为结构化的数据。
在处理医疗数据中的文本数据时,一个基本思路是使用自然语言处理技术,从非结构化的数据中提取信息,并将其转化为结构化的数据。
例如,从一个非结构化的医疗文本数据中提取关键信息,可以将其转化为结构化的表格数据。左边的图展示了医疗文本数据的例子,显示了病人的基本信息、病史、诊断和治疗信息。这些信息在临床上非常重要,但在处理大量病人数据时,人工读取变得不切实际。这时,自然语言处理技术可以将这些重要信息从非结构化的文本数据中提取出来,转化为结构化的表格数据。
自然语言处理方法主要分为两类:基于规则的方法和基于机器学习的方法。
基于规则的方法:这种方法是通过预先设定好的规则,使用模式匹配技术提取关键信息。这种方法的优点包括简单、运行速度快、可解释性强,但需要人工设置规则,且对于复杂系统难以维护。
基于机器学习的方法:这类方法通过从文本数据中提取特征,利用机器学习算法预测和提取关键信息。目前流行的深度学习方法是从数据中学习词向量,即根据语境对每个单词学习一个词向量,该词向量含有语义信息,再基于词向量使用机器学习算法进行分析。
接下来,我将介绍几个实际的应用案例。
我们医院使用自然语言处理技术来评估手术效果。具体来说,我们使用基于规则的方法从医疗文本中提取关键信息,例如手术过程、手术结果以及病人随访信息。这些信息包括手术是否使用了特定的手术方法(如nasal septal flap),以及术后的SNOT评分等。
通过这种方法,我们能够高效地处理大量数据,并得出有价值的结论。例如,我们发现使用特定手术方法的病人术后效果显著改善。
另一个案例是从电子病历数据中识别败血症病人。败血症是一种高死亡率的疾病,因此准确识别败血症病人非常重要。我们使用基于规则的方法从医疗文本中寻找败血症病人,并使用规则排除含有否定词的病人。最终,我们的算法准确率达到了98%,比直接使用ICD代码识别败血症病人多找出30%的病例。
找到这些病人后,我们可以使用这些数据训练机器学习模型,进一步预测败血症的发生。
另一个有趣的案例是利用自然语言处理技术构建医疗知识图谱。通过从文本中提取关键信息,构建知识图谱,可以表示症状和疾病之间的关系、药物和疾病之间的关系等。这种方法可以有效地将非结构化的医疗文本数据转化为结构化的表格数据,并使用机器学习算法学习出知识图谱。
通过知识图谱,可以准确地推断出疾病的可能症状,这对于智能问诊有很大的帮助。
除了上述案例,自然语言处理在医疗中还有很多其他应用,例如:
尽管目前已有许多学术研究,但大多数研究仍停留在学术层面。我希望未来能有更多的实际应用,将自然语言处理技术应用于临床实践,解决实际问题。
下面是一些常见的自然语言处理软件和数据库:
以上是我对自然语言处理在医疗中的应用所做的简要介绍。希望这次分享对各位老师有所帮助。接下来,苏博士将从国内医学和工业界的角度进一步探讨这一主题。
各位老师,大家好!非常荣幸能在此向各位老师学习!关于自然语言处理在医学和学术界的应用,陈章博士已经做了精彩的分享。接下来,我将从国内医学和工业界的角度进行讨论。今天的报告将分为四个部分:1)医疗文本是什么?有哪些类型?2)医疗文本的价值何在?3)如何处理医疗文本?4)医疗文本的用户群体和典型产品有哪些?
我叫苏丽娟,是浙江大学计算机科学与技术专业的博士。现任腾讯天衍实验室和腾讯医疗大数据实验室的医学AI研究员。曾在美国哈佛大学医学院附属医院麻省总医院担任研究助理,并在美国亚利桑那大学担任计算神经科学研究助理。参与多项国家重点基础研究发展计划、中国自然科学基金、美国国家科学基金等项目。主要研究方向为医疗人工智能、机器学习、认知计算和脑机接口等,并发表了多篇国际学术论文。这是我的邮箱和微信(邮箱: susie.lijuan@gmail.com,微信: LijuanSusie),期待有兴趣的朋友可以线下做进一步的沟通!
医疗文本从数据产生的来源可以分为两类:医学知识和临床数据。医学知识是静态的权威信息,存在于临床指南、医学教材、医学文献和互联网百科中。临床数据则是动态的个性化数据,包括门急诊病历、住院病历、病历摘要、检验检查、医嘱手术等。
自然语言处理可以分为两类:自然语言理解(理解文本意思)和自然语言生成(产生新文本)。自然语言处理在医疗文本中的应用包括:理解文本意思,例如情感分类、辅助诊断;生成新文本,例如摘要、翻译等。
医疗文本可以分为四个维度:
例如:主观信息包括呼吸短促、咳嗽、发热;客观信息包括血压、脉搏、体温、肺部干啰音等;评估信息包括急性支气管炎;计划信息包括药物疗法:阿司匹林胶囊500mg,每日2次,阿司匹林减量至32mg。
医疗文本在科研和学术上有很大的价值。例如:
医疗文本在市场上的价值也非常大。电子病历市场规模预计从2017年的65亿元增长到2021年的219亿元,呈现线性增长。未来随着电子化的发展,电子病历的智能化将成为必然趋势,自然语言处理技术将在其中发挥重要作用。
处理医疗文本的技术架构主要包括以下几个步骤:
具体算法框架包括传统方法和深度学习方法。传统方法的优点包括人工定义和抽取特征,准确快速可解释;缺点包括专业知识强,疾病拓展成本高。深度学习方法的优点包括半自动学习特征表示,适用于时序多模态数据;缺点包括训练样本需求大,特征可视化和可解释性待提高。
医疗文本处理的机遇包括市场、政策、数据、算力和算法的支持。挑战包括人才短缺、数据问题、算法模型问题和运营推广问题。解决方案包括明确需求和问题定义,多学科合作;半监督学习、迁移学习和人机协作;模型分层,模型和特征可视化;AI辅助人工,提高效率,降低成本。
我参与的一些典型产品案例包括:
请问两位老师,医学AI的核心价值是什么?目前使用的一些号称医学AI的产品,不但没有帮医生提高效率,反而增加了很多额外的时间成本,您们怎么看这个问题,未来的趋势是什么?
苏丽娟 医学AI的核心价值主要有两个方面:时间和金钱。例如,以前去医院挂号和付款需要排队1小时,现在通过微信预约和支付只需几分钟。此外,通过远程会诊或跨境诊疗,患者可以在本地就医,节省了路费、住宿费等开支。
陈章 这是一个很好的问题。我认为未来AI在医疗领域会有很大作为。相比互联网领域,医疗领域的特殊性在于直接涉及生命健康。因此,AI在医疗领域的应用会相对保守。目前很多AI医疗产品由互联网领域转向医疗领域,缺乏以医疗为本的关键,导致应用效果不佳。此外,医生对AI产品的熟悉程度也是一个重要因素。
苏丽娟 目前医疗AI产品带来额外开销的原因很多,例如技术不够成熟、市场教育滞后、预期过高。任何技术都需要适应期,可以通过运营方式逐步智能化。例如,在问答对话中,机器人自动产生回复,人工审核后进行微调,可以节约约90%的人工成本。
医学是事关人命的严谨科学,根据两位老师的经验,如果医学AI出错,应该如何负责?谁来负责?
苏丽娟 医学AI无法独立做决策,更多的是医生的小助手。即便是辅助决策,也需要通过FDA或CFDA进入临床,有严格监管。类似影像报告,也是提供影像所见给医生,主治医生再做诊断和治疗。短期内,医学AI不太可能做决策,决策者仍然是医生。
陈章 这是一个很好的问题。医院里经常讨论这个问题。我认为有两点:1. 开发的模型或算法必须有可解释性,即模型算法做出预测后,医生能明白其中的逻辑或事实依据;2. 模型算法不是取代医生,而是帮助医生,任何结果都需要医生去核实,最终判断还是由医生来做。
感谢两位老师的讲座!从二位老师讲的内容来看,AI经历了三起三落,那么医学AI呢?您们怎么看现在和未来的发展趋势?
陈章 这是一个很好的问题。我认为未来AI在医学领域会有很大作为。相比互联网等领域,医疗领域的特殊性在于直接涉及生命健康。因此,AI在医疗领域的应用会相对保守,但未来的发展会是一个漫长的过程。
请问两位老师,除了需求和安全问题,医学AI是否能像其他产品一样,给用户带来认同和归属感?
陈章 我认为医学AI如果能在医院中广泛应用,用户(医生或病人)可能感觉不到它的存在,因为很多算法模型直接部署在应用的后端,所以很可能不存在认同感和归属感问题。
苏丽娟 这是一个开放的问题。如果是B端产品,可能不存在认同感问题。如果是C端产品,一个好的产品必须满足核心价值和安全性。在此基础上,如果能满足认同归属感,那就是经典的产品,例如某款手机、家庭健康计划、重疾险。认同感和归属感意味着产品不仅解决了用户的问题,还有身份的认可。
两位博士的讲座非常精彩!谢谢。我有一个问题想请教陈章博士。在美国临床中,医生的手写病历占比多少?NLP如何处理书写病历的内容提取?NLP是否对中文文本处理比英文更具难度?
陈章 据我所知,美国医院病历记录主要有两种方式:一种是医生在电脑上打字生成的文本,另一种是医生通过语音,软件将其翻译成文本。真正靠医生手写记录的情况在美国医院已很少见,如果有数据存在,则需使用OCR技术。
苏丽娟 补充一点,如果是打印的病历,通过手机拍摄,可以做到一定的精度,但未必非常准确。如果是医生手写的病历,OCR识别效果较差。
观众d 确实如此。但在中国,我们接触到的临床一线门诊医生,大多数仍在手写病历,这给我们后期数据分析带来了很大的困难。
苏丽娟 基本处理流程是:电子化 → 结构化 → 智能化。如果尚未电子化,目前面临的挑战较大。从电子化到结构化,目前有一些自动提取方式,也可以半结构化。再到使用统计、规则、机器学习算法实现智能化。
观众d 第一步不解决,后面步骤都无法进行。
陈章 是的。我接触过一些国内医院信息科的朋友,现在很多医院已经开始电子化的过程,这将是未来的一个趋势。
观众d 中国医院的门诊量巨大,为医生提供好用的记录工具(语音转化或记录工具),可能是第一步。
两位老师好,请问如果我们医院没有电子化的医疗系统,还在用手写的纸质病历,可以使用讲座中提到的技术吗?
陈章 讲座中提到的技术是在病历已电子化的基础上。目前很多医院已经开始或全面病历电子化。只有电子化的数据才能被电脑读取,进而使用各种统计或机器学习算法。
陈博士您好,请问中国医疗数据和美国医疗数据有什么不同?讲座中提到的方法和案例可以直接用在国内的数据上吗?
陈章 您好!美国医疗数据主要是英文数据,而中国数据主要是中文数据。中文文本处理和英文文本处理在自然语言处理上有所不同,例如中文分词比英文分词困难很多。另外,由于人群差异,美国人群适用的模型不一定在中国人群中适用。因此,需要针对具体问题和数据进行具体分析。
为了促进大家更好地交流、丰富分享内容,我们计划推出全新的分享内容:《病例大讲堂》。《病例大讲堂》将会邀请国内外顶级临床医生老师,在微信群内分享他们在实际工作中遇到的经典案例,并与大家交流讨论。
第1期病例大讲堂《一例舒-戴二氏综合征(Shwachman-Diamond Syndrome)案例分享》将于2018年11月13日(下周二)晚上6:30-7:30,在【基因大讲堂——遗传神经科研与临床】和【基因大讲堂——癫痫科研与临床】两个微信群内同时进行。本次病例大讲堂的主讲人为来自中国人民解放军总医院儿内科的孟岩副主任,欢迎申请参加。
赛福基因公开课▪特辑7:《结合临床数据探寻B细胞肿瘤新型靶点的实例分析》课程视频将于2018年11月15日(下周四)晚上6点上线。本次公开课的问答环节将在2018年11月18日(下周日)中午12-13点,在「基因大讲堂——肿瘤科研与临床」群内进行,欢迎申请参加。