2019年7月1日,清华大学人工智能研究院自然语言处理与社会人文计算研究中心正式揭牌。这是清华大学人工智能研究院成立的第八个研究中心,标志着清华大学在人工智能领域的研究又迈出了坚实的一步。清华大学副校长、人工智能研究院管委会主任尤政院士和人工智能研究院院长张钹院士共同为中心揭牌。人工智能研究院院长助理朱军教授主持了成立仪式。
尤政院士在致辞中强调,自然语言处理是计算机科学领域的重要方向,被誉为“人工智能皇冠上的明珠”。清华大学作为国内最早开展自然语言处理研究的单位之一,历经四十年的努力,已成为国内外自然语言处理研究的重要力量。此次研究中心的成立,不仅有助于推动清华大学人工智能的深入发展,还能促进自然语言处理与社会科学及人文科学的深度融合,为国家人工智能战略贡献力量。
张钹院士在致辞中提到,语言是人类智能的重要标志,机器自然语言理解是人工智能的最终目标。清华大学在自然语言处理领域积累了深厚的研究基础,特别是在黄昌宁教授的指导下,自然语言处理成为国内领先的科研方向。新成立的中心致力于实现自然语言处理与人文社会科学的深度融合,不仅要将人工智能技术应用于人文科学领域,更要从语言、社会学、人文等多个角度深入探讨人类智能的本质。
成立仪式上,尤政院士和张钹院士共同为中心揭牌,并向清华大学人工智能研究院常务副院长孙茂松教授颁发了中心主任聘书。研究中心还聘请了多位知名学者担任学术顾问,包括中国中文信息学会原理事长倪光南、滑铁卢大学讲座教授李明、微软亚洲研究院副院长周明以及英国帝国理工学院数据科学研究所所长郭毅可。
自然语言处理与社会人文计算研究中心的核心任务是围绕人类语言所体现的人类智能本质,重点研究鲁棒且可解释的自然语言处理方法和技术。中心将探索自然语言理解和生成技术在社会人文计算领域的应用,建设以中文为核心、覆盖多种语言的全流程自然语言处理技术框架和计算平台。
研究中心的主要研究方向包括: - 面向多粒度语言单元的一致语义表示框架; - 从词法到篇章的全流程自然语言处理技术体系; - 数据与知识融合的多语言机器翻译技术; - 知识指导的自然语言深度理解与智能推理技术; - 跨模态自然语言学习与处理; - 基于自然语言处理的社会人文计算,包括智能创作、智能语言学习、智能教育、智能司法、智能传播和智能音乐等。
刘洋副教授介绍了开源成果THUMT,这是一个基于深度学习的机器翻译系统。该系统采用数据驱动的机器翻译技术,具有良好的语言相关性,在具备训练数据的情况下可以快速部署新语言系统。THUMT支持多种语言的机器翻译,包括汉语、英语、日语、俄语、西班牙语、葡萄牙语、德语、法语、阿拉伯语和维吾尔语等。该系统已在外交部、新疆公检法等政府部门和搜狗、百度、捷通华声等互联网企业中广泛应用,为大规模多语言信息的深度分析和高效服务做出了重要贡献。
矣晓沅博士生介绍了开源成果THUAIPoet(九歌),这是一个基于深度学习神经网络技术的中文诗歌自动生成系统。九歌支持多种体裁诗歌的在线生成,包括集句诗、绝句、藏头诗和词等。该系统曾在CCTV-1《机智过人》节目中与人类诗人同台竞技,表现出色。九歌开源了无监督风格诗歌生成模型StylisticPoetry的源码,并发布了两个高质量的诗歌数据集以及国内外诗歌生成的相关论文列表。
刘知远副教授介绍了开源成果OpenCLaP,这是一个多领域中文预训练模型仓库。通过在大规模中文文本上的预训练,这些模型可以在下游任务上进行微调以提高性能。本次开源的模型基于法律文本和百度百科数据,支持最大512长度的文本输入,适用于多种任务需求。未来,中心将继续推出更多强大的预训练模型,如增加训练语料、引入大规模知识等。
中心团队提出了一套融合大规模知识的中文语义表示学习方法,旨在实现对互联网海量文本、语言知识和世界知识的深度理解和计算。该方法在自然语言处理的重要国际期刊和会议上发表了40余篇论文,被多家知名研究机构列为代表性方法,并获得了大量引用。
中心团队在实体关系抽取等关键知识获取任务上进行了深入研究,创造性地提出了句子级别选择注意力机制和对抗训练机制等技术方案,有效缓解了远程监督训练数据的噪声问题,并更好地利用了跨语言训练数据。团队构建了多个大规模标注数据集,如FewRel和DocRED数据集,相关研究成果在自然语言处理的重要国际期刊和会议上发表了十余篇论文。
中心团队深入研究智慧司法任务,提出了多项关键技术,如要素式多任务判决预测、要素判决预测和神经网络信息抽取等。这些技术为法律智能提供了高效的解决方案,并构建了大规模数据集用于训练机器学习模型。中心还组织了国内首个法律智能挑战赛,吸引了来自国内外的600多支参赛队伍,显著提升了我国法律智能研究和应用水平。
李明院士在报告中指出,当前的第一代聊天机器人存在缺乏理解能力和学习能力的问题,主要原因是现有的深度学习技术尚未具备理解人类语言所需的概念抽象和逻辑推理能力。他认为,第二代聊天机器人的主要目标是实现理解和学习能力,机器人需要通过自动学习和社会参与来不断提升自身的能力。
周明博士在报告中回顾了基于神经网络的自然语言处理的研究进展,指出现今面临的关键挑战包括高昂的计算成本、大规模标注数据的稀缺以及难以实现真正理解与推理等问题。他建议从计算能力、数据资源、模型算法、系统应用、人才培养和交叉合作等六个方面进一步推动自然语言处理的发展。
通过这些研究和报告,清华大学自然语言处理与社会人文计算研究中心展现了其在人工智能领域的强大实力和广阔前景。