王海峰博士领军的百度自然言语处理技术再获国际认可

图灵汇官网

近日,自然语言处理(NLP)领域的国际顶级学术会议“国际计算语言学协会年会”(ACL 2019)公布了今年大会论文的录用结果。据统计,今年大会的有效投稿数量达到了2694篇,相比去年的1544篇增长了75%。其中,国内自然语言处理领域的领军企业百度有10篇论文被大会收录,展示了其在该领域的深厚技术和国际水平。

国际计算语言学协会(ACL)成立于1962年,是自然语言处理领域最有影响力的国际学术组织之一。自成立以来,ACL致力于推动计算语言学及自然语言处理相关研究的发展和国际学术交流。百度高级副总裁、AI技术平台体系(AIG)和基础技术体系(TG)负责人王海峰曾在2013年担任ACL主席,成为ACL五十多年来首位华人主席,同时也是ACL亚太分会(AACL)的创始主席和ACL会士。入选ACL的论文意味着研究成果得到了国际学术界的认可。

百度此次被收录的10篇论文涵盖了信息抽取、机器阅读理解、对话系统、视频语义理解、机器翻译等多个NLP领域的热点和前沿研究方向。其中包括基于注意力正则化的ARNOR框架、将语言表示与知识表示深度融合的KT-NET模型、多粒度跨模态注意力机制、基于端到端深度强化学习的共指解析方法等。这些研究在人机交互、智能客服、视频理解、机器翻译等应用场景中具有显著的应用价值。

对于百度而言,在国际学术界取得这样的成就并不意外。王海峰博士作为自然语言处理领域的国际领军人物,其在自然语言处理领域的研究及工程成果得到了国际同行的广泛认可。由他领导的百度自然语言处理团队,在自然语言处理技术的发展及应用上始终处于领先地位,不断吸引和培养海内外的顶尖人才。

百度的自然语言处理技术全面支持公司的各项业务,是智能搜索、信息流、智能家居等产品的核心技术。同时,百度积极开放其核心能力,赋能各行各业,助力产业智能化升级。作为百度大脑开放平台的核心组成部分,自然语言处理相关技术的日均调用量已超过千亿次,广泛应用于互联网、金融、医疗、零售、出行、服务等行业。在中国各行业积极拥抱人工智能技术的大背景下,百度自然语言处理技术正在为中国产业的智能化进程做出重要贡献。

以下是百度被收录的ACL 2019论文概览:

  1. ARNOR: 基于注意力正则化的噪声减少框架

    • 摘要:远监督通过知识库自动获取标注语料,是关系抽取的关键算法。然而,远监督通常引入大量噪声数据。为此,我们提出ARNOR框架,通过注意力机制识别噪声数据,并通过Bootstrap方法逐步选择高质量的标注数据,改善模型效果。
    • 应用价值:在文本信息抽取中有广泛应用,尤其适用于医疗、金融等行业信息抽取。
  2. KT-NET: 融合语言表示与知识表示的模型

    • 摘要:预训练语言模型在机器阅读理解任务上取得了突破性进展,但真正意义上的阅读理解不仅需要语言理解能力,还需要知识的支持。为此,百度提出了KT-NET模型,将语言表示与知识表示深度融合,提升机器阅读理解效果。
    • 应用价值:可用于搜索问答、智能音箱等产品,提升用户体验。
  3. 复合评估的对话策略

    • 摘要:现有的对话系统缺乏对多轮对话方向的控制和规划。本文提出复合评估方法,通过强化学习优化对话策略,提升对话质量。
    • 应用价值:可用于对话系统、智能客服。
  4. 基于知识图谱的自动对话任务

    • 摘要:本文提出了一种基于知识图谱的自动对话任务,通过知识图谱引导对话进程,保持对话的自然流畅。
    • 应用价值:可用于智能音箱中的对话技能,也可开发闲聊技能。
  5. 多粒度跨模态注意力机制

    • 摘要:本文提出了一种多粒度跨模态注意力机制,增强对复杂图像和细节信息的理解,提升视觉问答(VQA)的准确率。
    • 应用价值:可用于基于多模态信息和知识图谱的小视频内容理解项目。
  6. 提高最近邻搜索的方法

    • 摘要:本文提出了一种提高最近邻搜索的方法,不仅能提高双语词典编纂的准确性,对涉及最近邻搜索的任务也有指导意义。
    • 应用价值:可用于机器翻译,特别是在小语种和专业文献的翻译中。
  7. STACL: 超前预测和可控延迟的同声翻译算法

    • 摘要:同声翻译是人工智能领域的一大难题,本文提出了首个超前预测和可控延迟的同声翻译算法,已在百度世界大会上成功应用。
    • 应用价值:可用于同声传译系统。
  8. 基于模拟学习的同声翻译算法

    • 摘要:本文提出了一种基于模拟学习的同声翻译算法,通过动态策略实时灵活地决定是否需要等待更多信息继续翻译,从而提高翻译质量。
    • 应用价值:可用于同声传译系统。
  9. 结合文本和语音嵌入的神经机器翻译

    • 摘要:本文旨在提高翻译的鲁棒性,特别是在同音词噪音条件下的性能。通过结合嵌入的方式,加入输入单词的发音信息,显著提高了翻译系统的鲁棒性和性能。
    • 应用价值:可用于语音到语音的同声传译系统。
  10. 基于端到端深度强化学习的共指解析

    • 摘要:本文首次提出了基于端到端深度强化学习的共指解析方法,优化共指解析的评价指标,在OntoNotes数据集上取得了良好效果。
    • 应用价值:可用于知识图谱构建和信息抽取。

这些论文展示了百度在自然语言处理领域的创新能力和技术实力,为行业发展提供了重要的参考和借鉴。

本文来源: 图灵汇 文章作者: 沃达丰会展