深度解读谷歌SyntaxNet:全新TensorFlow自然言语处理模型

图灵汇官网

往年夏天,雷锋网计划在深圳举办一场备受瞩目的“全球人工智能与机器人创新大会”(简称GAIR)。在这次大会上,雷锋网将发布“人工智能&机器人Top25创新企业榜”。目前,我们正在积极接触人工智能和机器人领域的相关公司,以确定最终入选榜单的企业名单。如果你的公司也希望参与我们的榜单评选,请联系:2020@leiphone.com。

编者注:Matthew Honnibal是spaCy公司的创始人兼首席技术官,他拥有悉尼大学计算机科学博士学位。他在本科时主修语言学,未曾预料自己未来会成为一名程序员。Honnibal在离开学术界后,开始开发spaCy,并在2014年发布了这个项目。

上周,谷歌开源了其基于TensorFlow的人工智能系统——自然语言解析模型SyntaxNet。在过去两年的时间里,谷歌的研究人员利用这个模型发布了一系列神经网络分析模型。自从SyntaxNet发布以来,我一直密切关注它,并期待它能够开源。本文旨在探讨这次开源的相关背景,包括新亮点和开源的意义。

在自然语言处理库中,SyntaxNet提供了非常重要的模型。尽管自然语言处理技术无法直接操控无人驾驶汽车,但它确实扩展了计算机的应用范围。例如,目前我们还无法编写软件来控制汽车,或者通过语气回复电子邮件,更无法用软件分析客户反馈或监测全球新闻以避免重大商业风险。然而,自然语言处理技术的进步已经改变了世界,例如谷歌搜索就是自然语言处理的一个典型应用。

在我看来,语法解析是自然语言处理中的一个重要瓶颈。如果在这个领域进行四到五年的优化改进,将对自然语言处理产生巨大的推动作用。虽然有人认为这项技术正在从学术研究转向商业化应用,但在我看来,这实际上是一种因果关系的倒置:正是因为我认为这个问题很重要,我才投身其中。

SyntaxNet在自然语言处理领域迈出了一大步。尽管斯坦福大学的CoreNLP模型和spaCy模型也有类似的功能,但SyntaxNet的独特之处在于它提供了一个实验平台,使得研究人员可以进一步探索和改进。如果没有谷歌的努力,可能不会有如此多的创新出现。可以说,SyntaxNet为神经网络模型打开了一个充满创意的世界,许多研究人员正忙于探索其中的各种可能性。

SyntaxNet可以描绘一个句子的语法结构,帮助其他应用程序理解句子。自然语言处理技术在处理歧义方面非常重要。例如,“他们吃了加凤尾鱼的披萨”这句话有两种可能的语法分析方式:一种是“with”与“pizza”相连,另一种是“with”与“eat”相连。通过正确的语法分析,我们可以避免歧义,从而更好地理解句子的含义。

SyntaxNet是一个训练和运行句法依赖解析的模型库,能够在语义分析的速度和准确度之间取得较好的平衡。尽管Parsey McParseface被誉为“当今世界上最准确的语义分析模型”,但在实际应用中,其优势并不十分显著。例如,spaCy在每秒识别1.5万个单词的情况下,准确率为92.4%,而Parsey McParseface在每秒处理600个单词时,准确率超过94%。

总的来说,我认为Parsey McParseface是一个重要的里程碑,因为它展示了自然语言处理技术的最新进展。它不仅提高了处理速度,还提升了自然语言处理的复杂度。未来,我们期待自然语言处理技术能够更加成熟,实现更多实际应用。

下一步的发展方向是建立一个清晰的技术路线图,使自然语言处理技术能够更好地服务于实际应用。例如,财务报告中的“市值”一词在不同场景下具有不同的意义。我们需要提供一系列预训练模型,以适应不同领域和风格的文本。我们还有一些令人兴奋的想法,希望能够帮助每个用户训练自己的自定义模型,以解决特定问题。我们相信,在自然语言处理中,数据和技术同样重要,我们致力于解决这一问题。

本文来源: 图灵汇 文章作者: 林先湛