2019 自然言语处理前沿论坛,百度NLP技术全揭秘

图灵汇官网

近日,百度联合中国计算机学会中文信息技术专委会、中国中文信息学会青工委举办了“2019 自然语言处理前沿论坛”。此次论坛的主题是“机器之‘读、写、说、译’——探寻 NLP 未来之路”,来自百度和各大高校的专家们分享了他们在自然语言处理(NLP)领域的研究成果和实践经验。

语义计算

百度 NLP 主任研发架构师、语义计算技术负责人孙宇分享了百度在语义计算方面的进展。他提到,语义计算的目标是将语言符号转化为具有等价语义且更容易计算的形式。百度在这一领域的工作包括语义表示学习、语义匹配计算、语义解析和多模态语义计算。早期,百度采用基于检索和主题模型的方法,后来转向基于深度学习的词嵌入技术。近年来,百度提出了知识增强的语义表示模型 ERNIE,并发布了基于 PaddlePaddle 的开源代码和模型。ERNIE 模型在多个中文数据集上取得了最佳效果,展示了其强大的语义理解和处理能力。

自动问答

百度 NLP 资深研发工程师、阅读理解与问答技术负责人刘璟介绍了百度在阅读理解领域的研究和应用。机器阅读理解技术旨在让机器理解文本内容并回答相关问题。百度研发了面向搜索场景的多文档阅读理解模型 V-NET 和知识表示与文本表示融合模型 KT-NET。V-NET 模型在英文多文档阅读理解数据集上表现优异,KT-NET 则在常识推理阅读理解数据集 ReCoRD 上名列前茅。为了推动中文阅读理解技术的发展,百度推出了大规模中文阅读理解数据集 DuReader 2.0,并举办了相应的评测活动。

言语生成

百度 NLP 主任研发架构师、篇章理解与语言生成技术负责人肖欣延分享了自然语言生成技术的研究和应用。自然语言生成技术旨在让机器像人类一样进行表达和创作。肖欣延指出,自然语言生成可以应用于多种任务,包括数据到文本生成、文本到文本生成、创意写作和多模态生成。百度在这些任务上进行了多项创新,例如基于深度学习的足球比赛快讯生成和基于神经网络的诗歌生成。肖欣延认为,智能写作平台可以帮助创作者提高内容创作效率和质量,实现自动化、生动和富有深度的内容生成。

人机对话

百度 NLP 主任研发架构师、UNIT 技术负责人孙珂博士介绍了对话系统的技术探索。随着智能对话技术的广泛应用,企业面临着建设对话系统成本高昂的问题。为此,百度开发了智能对话系统定制与服务平台 UNIT,提供了包括任务型对话系统、问答型对话系统和闲聊型对话系统在内的多种解决方案。UNIT 平台通过融合语义表示预训练模型 ERNIE 和数据辅助生产工具 DataKit,显著降低了对话系统研发成本。此外,UNIT 还提供了一套对话容错机制,提升了对话系统的整体效率。

机器翻译

百度人工智能技术委员会主席何中军介绍了机器同声传译的进展与展望。同声传译是一项高难度的任务,要求极高的实时性和准确性。然而,当前机器同声传译面临技术、数据和评价三大挑战。百度提出了结合词向量编码模型和可控时延的翻译模型,解决了噪声和延迟问题。此外,百度还提出了多轮解码策略和基于知识蒸馏的同传模型,进一步提高了翻译质量和流畅度。为了推动机器同声传译技术的发展,百度发布了面向真实场景的中英同传评测任务和数据集,并提出了未来在模型、数据和评价体系方面的改进方向。

以上内容涵盖了百度在自然语言处理领域的最新进展和应用,展示了其在语义计算、自动问答、语言生成和人机对话等方面的技术实力。

本文来源: 图灵汇 文章作者: 先进制造业