3月8日,云从科技与上海交通大学联合宣布,在自然语言处理(NLP)领域取得了重要进展。他们在大型深层阅读理解任务的数据集RACE(源自英语考试的阅读理解数据集)中获得了第一名。这一成就被认为是机器深度理解人类语言的新起点。
在相关论文中,云从科技和上海交通大学提出了一个基于原创DCMN算法的新模型,使得机器阅读理解的准确率提升了4.2个百分点。在高中测试题目部分,机器首次超过了人类的表现,准确率达到69.8%,而人类平均准确率为69.4%。
这项研究成果表明,当结合文字识别(OCR)和语音识别技术时,NLP技术将帮助机器更准确地理解人类的文字和语言。这一技术将在多个服务领域得到广泛应用,例如帮助企业评估客户风险、审查外部文件的合规性、从语义层面搜索相关信息等。此外,它还能辅助社交媒体和推荐引擎中的文本审核工作,从而减轻人工负担。
RACE数据集是从中学考试题目中收集而来的一个大规模阅读理解数据集,包含约28000篇文章和近100000个问题。其形式类似于英语考试中的阅读理解选择题,即给出一篇文章,需要通过阅读并理解文章内容,然后从四个选项中选择正确答案。正确答案往往需要通过对文章的深层理解、线索分析及上下文推断才能得出。这种类型的阅读理解比传统的抽取类阅读理解更为复杂,因此被称为“深度阅读理解”。