清华成立自然言语处理与社会人文计算研讨中心,孙茂松任主任

图灵汇官网

清华大学成立自然语言处理与社会人文计算研究中心

言语智能是人工智能领域的关键突破点,一旦取得重大进展,将推动知识和推理的发展,从而极大提升整个AI体系的水平。7月1日,清华大学在北京宣布成立自然语言处理与社会人文计算研究中心,人工智能研究院常务副院长孙茂松出任该中心主任。

此次中心的成立正值清华大学人工智能研究院成立一周年之际,这也是该研究院旗下的第八个研究中心。该机构的设立旨在整合校内优势研究力量,推动人工智能的原始创新。在此之前,清华大学已经相继成立了人工智能研究院基础理论研究中心、智能信息获取研究中心等多个研究机构。

探索人类智能本质

「人类语言是人类智能本质的体现,自然语言理解被誉为人工智能皇冠上的明珠,」清华大学副校长、中国工程院院士尤政在成立仪式上表示。「这一概念在AI出现之前就已经是顶级大学研究的重要方向,也是计算机学科的经典研究领域。它是当前AI研究的制高点。」

自然语言处理(NLP)是计算机迈向智能化的必由之路,研究NLP不仅能够促进技术进步,还能在信息安全等领域发挥重要作用。作为国内顶尖学府,清华大学是国内最早开展自然语言处理研究的高校之一,早在1978年就在黄昌宁教授的指导下成立了人工智能和智能控制教研组。

在多年的发展中,清华大学始终瞄准国际前沿,经过不懈努力,已经成为国内外自然语言处理研究的重要力量。不同于其他大学的相关机构,清华大学成立的NLP研究中心致力于与社会科学和人文科学相结合,具有跨学科研究的特点。

「从研究院的整体布局来看,我们将自然语言处理视为人工智能基础研究的一部分,」清华大学人工智能研究院院长、中国科学院院士张钹表示。「自然语言处理应与社会学、人文学深度融合。我们希望研究中心能够在交叉研究中形成特色,从而引领国内学术界的发展。」

张钹院士指出,交叉学科研究不仅仅是将AI或深度学习工具应用于其他学科,而是要以社会学、人文学等其他学科的方式思考AI,寻找自然语言处理和人类智能的本质。

NLP研究中心的成立不仅有助于人工智能技术的发展,对于其他学科也具有重要意义。此前,清华大学已经在交叉学科上开展了多项AI研究。例如,清华大学法学院正在进行计算法学、研究官方借贷、交通规则等方面的研究。法学院院长申卫星教授表示。

开源前沿研究成果

在研究中心成立的同时,清华大学还举办了自然语言处理前沿学术报告会和开源成果发布会,研究中心的研究团队发布了机器翻译、深度学习中文诗歌生成系统以及自然语言预训练模型等最新研究成果。

THUMT是清华大学2017年6月发布的深度学习机器翻译系统。该系统采用数据驱动的机器翻译技术,具备良好的语言相关性,在有训练数据的情况下可以快速部署新语种。昨天,刘洋教授发布了在TensorFlow平台上开发的新版THUMT系统,该系统采用主流的Transformer模型,集成了当前最先进的神经机器翻译技术,具有训练速度快(支持多机多卡并行)、显存占用低(支持单精度浮点数计算)、翻译效果好(与国际机器翻译开源软件相比名列前茅)、易于可视化分析(支持层次相关反馈算法)等优点。

此外,清华大学还开放了包含70万句对的句级对齐汉英平行语料库和4万句对的词级对齐汉英平行语料库。

项目地址:thumt.thunlp.org

刘知远副教授在活动中发布了新工具OpenCLaP(Open Chinese Language Pre-trained Model Zoo),这是一个多领域中文预训练模型库。通过在大规模中文文本上的预训练,这些模型可以在下游任务中进行微调以提高性能。此次开源成果公布了多个基于千万级文本的预训练模型,支持最长512长度的文本输入,适用于多种任务需求。

OpenCLaP采用BERT作为通用框架,目前已经支持民事文书、刑事文书、百度百科等领域的预训练模型。刘知远表示,清华大学NLP团队未来将继续在OpenCLaP中加入更多强大的预训练模型,如增加更多训练语料、引入大规模知识、采用全词覆盖策略等。

  • OpenCLaP GitHub网址:github.com/thunlp/OpenCLaP
  • 项目网址:zoo.thunlp.org
本文来源: 图灵汇 文章作者: 金娇