图像识别和自然语言处理是当前最普及的两种AI技术。尽管图像识别技术已经相当成熟,在某些领域甚至能达到近乎百分之百的识别率,但自然语言处理技术的发展仍远落后于图像识别技术。
自然语言处理的复杂性主要源于其内在的不确定性。无论是词汇、语法还是语用层面,都存在大量的歧义问题。即使形式相同的一段文字,在不同的场景或语境下,也可能被解读出不同的含义。这种不确定性使得单纯依靠神经网络来处理自然语言变得极为困难。
由于处理上的局限性,诸如亚马逊、谷歌、Facebook和苹果等科技巨头,在自然语言处理的语音助手功能上也曾遭遇挫折。这些公司在处理自然语言时,并不是完全依赖AI,而是需要大量人工参与,比如记录、转录等。虽然这种方式解决了部分问题,但同时也引发了隐私方面的争议。
消费者越来越担心自己的命令和预约等个人信息可能被云端工作人员完全掌握。因此,随着各国隐私调查机构的介入,这些公司逐步改善了它们的记录行为。近期,科大讯飞在同步翻译中引入人工干预,也引发了造假争议。尽管如此,厂商依然有责任向用户公开其处理流程,而非进行虚假宣传。
然而,如果自然语言处理仍然需要大量人工干预,那么这就不符合真正的“人工智能”定义。根据Juniper Research的预测,未来四年里,数字语音助手的数量将从25亿增长到80亿。Gartner则预测,到2021年,所有客户服务互动的15%将由AI完全处理,比2017年增长了四倍。这意味着自然语言处理技术的市场潜力巨大,但如果不能解决现有瓶颈,实现这一目标将十分困难。
NVIDIA的研究副总裁Bryan Catanzaro指出,尽管自然语言处理技术在研究和商业领域取得了快速发展,但教会计算机与人类进行高质量对话仍然是一个艰巨的目标。为了实现这一目标,需要构建能够理解对话细微差异的大型模型,并具备更强的上下文理解能力。此外,模型训练速度也需要加快,以便研究人员能够在合理的时间内进行迭代改进。
在推理方面,理想状态是实现即时响应,通常要求响应时间不超过10毫秒。如果计算模型的回答耗时过长,用户体验将会大大下降。
目前流行的自然语言处理模型是BERT,这是一种双向编码器,能够同时从文本的左右两侧进行评估。许多AI开发者认为BERT是自然语言处理领域的转折点,类似于2015年ResNet在图像识别领域的突破。
最近,NVIDIA宣布了一项新的自然语言处理模型训练计划,利用DGX-2 SuperPOD系统,能够在一小时内完成BERT模型的训练。相比过去需要几天时间才能完成同样的任务,现在只需一个小时。虽然92台DGX-2服务器的成本很高,但NVIDIA强调,这样做的效率更高,可以更快地部署模型。
BERT由谷歌研发,自那时起,许多公司推出了各自的变体,如Facebook的RoBERTa、阿里巴巴的Perseus-BERT和微软的MT-DNN。此外,XLNet模型结合了BERT和其他技术,也在不断进步。
部分模型已经在通用语言理解评估(GLUE)基准测试中超越了人类水平,这是衡量自然语言处理系统性能的标准。以下是目前排名前十的模型,其中人类基线排在第四位。
BERT-Large模型包含大约3.4亿个参数,而NVIDIA在DGX-2 SuperPOD超级计算机上构建了一个拥有83亿个参数的复杂网络。NVIDIA表示,为了完成一些此前无法实现的任务,必须构建如此复杂的模型。
在推理方面,NVIDIA指出,使用T4 GPU和TensorRT优化代码,BERT-Base模型在SQuAD数据集上的响应时间仅为2.2毫秒,远低于10毫秒的会话阈值。相比之下,使用CPU平台则需要40毫秒。此外,基于FPGA和专门设计的ASIC解决方案也可以提供相似或更优的延迟表现。