自然言语处理已到中级 大规模语料库提供强有力手腕

图灵汇官网

近年来,脑科学与类脑智能成为了全球各国研究的热点领域。在最近于天津举行的“类脑智能创新论坛”上,记者了解到,我国也将启动“中国脑计划”。自然语言处理技术是各种“脑计划”的核心技术之一,未来“中国脑计划”的发展离不开中文自然语言处理技术的突破。

自然语言处理已进入中级阶段

“简而言之,‘自然语言处理’是指让计算机能够像人一样使用语言文字。”山东大学文学与新闻传播学院教授盛玉麒解释道。“自然语言处理的核心任务是在人机交互中解决各种技术问题。”中国社会科学院语言研究所研究员李爱军指出,自然语言处理包括文本信息处理和语音信息处理。

盛玉麒将自然语言处理的研究和应用分为三个阶段:初级阶段主要解决语言文字的输入、输出、存储、传输、显示、打印、编辑、检索等功能;中级阶段则让计算机具备一定智能,能够自动识别自然语言指令,并按指令执行信息检索、数据提取、查询以及不同语言的自动翻译等任务;高级阶段则是智能化处理,其速度、容量和准确性都接近人类水平。

目前,学术界和产业界已经完成了初级阶段的任务,中级阶段也取得了一些关键性进展,例如电子词典、快译通、机器翻译等产品的出现,体现了相关技术的应用成果。盛玉麒提到,尽管如此,整体来看这些技术的应用效果还不够理想,自然语言处理的中级阶段仍在攻克难关,距离实现真正的智能化目标还有相当的距离。

规则与统计相结合破解自然语言处理难题

如何让计算机像人类一样使用语言文字?杭州师范大学的钱江学者讲座教授冯志伟,从事自然语言处理研究已有50多年,他表示:“为了使自然语言成为计算机可以直接处理的对象,我们需要建立语言的‘形式模型’,用数学方式表示,并建立自然语言的‘计算模型’,使其能在计算机上实现。”

李爱军指出,实现自然语言处理需要克服一系列难题,如单语分析中的语言歧义性、远程相关性、动态性、随意性,以及多语种任务中的语序差异、语义集合差异和表达习惯差异等。

就汉语而言,由于其词形变化少,语义更多依赖于上下文和场景关系;且语法结构灵活多变,因此在中文自然语言处理中面临更多挑战。多年来专注于汉语自然语言处理的盛玉麒对此深有体会,他认为,汉语的自动分词、词性标注、规则提取、规则描述和歧义消除等方面是中文自然语言处理的重要瓶颈。

自然语言处理的研究经历了从基于规则到基于统计,再到规则与统计相结合的过程。早期建立的大规模知识库为自然语言处理奠定了基础,但基于规则的方法难以应对大量变体和快速变化的需求,从而催生了基于统计方法的语言建模。盛玉麒强调,规则与统计相结合的方法已成为自然语言处理领域的共识。

急需汉语语言学界的参与

基于语料库的知识挖掘和数据提取已经成为智能化信息处理的领先技术,理论和实践也日趋成熟。冯志伟表示,大规模语料库的建立为自然语言处理提供了强有力的工具。

近年来,我国通过多项基金项目加大对自然语言处理尤其是少数民族语言处理的投入,开展互联网环境下白话语信息处理的基础理论和应用研究。李爱军介绍,这些研究主要包括互联网环境下白话语感知与表示理论研究;面向复杂环境的多语言识别方法与关键技术等。其中,中国社会科学院语音与语言科学重点实验室承担了国家973计划“互联网环境下白话语信息处理与深度计算的基础理论和方法项目”中的“互联网环境下白话语行为规律和篇章结构研究”子课题,已经成功构建了互联网中白话语信息的表示体系和大规模多模态口语语篇库。

针对当前中文自然语言处理存在的不足,盛玉麒认为主要原因在于计算机信息处理与汉语语言学的结合不够紧密,汉语语言学界对自然语言处理的关注和参与还不够充分。“计算机专家需要汉语语言学研究者的支持,将语言学家的知识、方法和思路转化为自然语言处理的数据库、知识库、方法库和规则库。”

本文来源: 图灵汇 文章作者: 大话区块