打通机器视觉与自然言语处理,Facebook正在让机器“看图说话”

图灵汇官网

《麻省理工科技评论》中英文版APP现已上线,年度订阅用户每周可参加科技英语讲堂,还能加入科技英语学习社区。

“视觉对话”是近年来新兴的研究领域,它结合了机器视觉、自然语言处理和对话系统三个热门研究方向,主要目标是教会机器如何通过自然语言交流视觉数据。

当前的对话系统覆盖范围广泛:一方面,有专门设计的任务型聊天机器人,例如预订机票的机器人;另一方面,则是闲聊机器人,可以随意交谈。视觉对话则位于这两者之间,它是一种自由对话,但对话内容受限于特定图像。

尽管视觉对话的研究尚处于初级阶段,但它已经展现出多种应用场景。例如,通过一系列问题帮助视力障碍者理解网上图片或拍摄的照片,或帮助医疗人员更好地解读医学影像。此外,它也可用于虚拟现实(VR)或增强现实(AR)应用中,使用户能用语言与虚拟角色就所见画面进行交流。

要实现这一目标,我们还需要解决很多基础问题。近期,Facebook在两个方面进行了探索:一是对视觉内容进行明确推理,二是创建拟人化的视觉对话。

对视觉内容进行明确推理

自然语言与视觉数据之间的重要联系之一是通过自然语言提问,如“图片中的动物是什么?”或“沙滩上有多少人?”虽然每个问题都需要解决不同的问题,但目前大多数先进系统都采用整体方法,如相似的计算图或网络来计算答案。然而,这种方法的解释性有限,并且在处理更复杂的推理任务时,例如判断“有多少物体体积与那个球相同?”时,效率不高。

为了改善这一点,加州大学伯克利分校的研究人员在2016年的CVPR会议上提出了一种“神经模块网络”,该网络可以将计算过程分解为明确的模块。在示例中,一个模块负责“寻找”图像中的球,另一个模块负责“寻找”体积相同的物体,最后一个模块则负责计数。重要的是,这些模块可以重复应用于不同的图像和问题,例如“球比立方体多吗?”的问题。

尽管早期的成功依赖于不可微分的自然语言处理器,但在2017年的ICCV会议上,两篇论文展示了如何通过端到端训练来构建这种系统。这些研究者发现,这种方法对于解决CLEVR数据集中的复杂问题至关重要。尽管这两篇论文采用了不同的架构,但它们都得出一个共同结论:在监督程序预测中,需要使用正确的参考程序来确保结果,但只需要少量训练数据。此外,第一篇论文还表明,通过强化学习优化网络可以获得更好的效果,甚至能够针对新问题和答案进行精确调整。

最近,又有两种网络架构——RelationNet和FiLM——被提出。这些架构在没有使用任何正确参考程序的情况下,仍然保持了性能,并有所提升。这表明,虽然原有的模块化推理结构更加清晰易懂,但新的架构同样有效。

此外,第一篇论文使用的是从人群中收集的问题,而不是CLEVR数据集中的生成问题。在这些问题上,没有任何模型表现出良好的泛化能力。同样地,当在VQA数据集的真实图像和问题上进行测试时,第二篇论文的效果也有限,可能是因为VQA数据集中的问题不需要像CLEVR数据集那样的复杂推理。总体而言,我们期待未来能在新框架和新技术的推动下,开发出更具组件性和可解释性的模型,应对实际应用中的新挑战。

拟人化的视觉对话

Dhruv Batra和Devi Parikh及其在佐治亚理工学院和卡内基梅隆大学的学生们研究了嵌入图像中的自然语言对话,并开发了一种新的数据收集协议,用于创建大规模的视觉对话数据集(VisDial)。该数据集包含了12万张图像的每段对话,每段对话包含10组问答,共计120万组问答。

由于视觉对话涉及多个研究领域的交叉,它促进了不同领域之间的合作,以解决共同的问题。为了促进这一领域的发展,Batra和Parikh公开了视觉对话数据集及相关源代码,使研究人员能够针对自己的需求开发数据集。

对话研究的一个有趣特点是将其视为静态监督学习任务,而非交互式代理任务。在监督学习中,每轮对话模型都会被人为地“注入”两个人类间的对话,并要求回答一个问题。然而,机器的回答会被丢弃,因为下一轮会提供人类的回答,而不是机器的回答。因此,机器永远不能引导对话,以免偏离数据集,导致无法评估。

为了克服这一问题,佐治亚理工学院、卡内基梅隆大学和Facebook人工智能研究院的研究人员开发了一款合作“图片猜测”游戏GuessWhich。游戏中,一个“提问者”Q-BOT和一个“回答者”A-BOT通过自然语言进行对话。在游戏开始前,A-BOT会被告知一张Q-BOT未知的图片,而双方都会获得相同的图片描述。每轮中,Q-BOT生成一个问题,A-BOT回答,然后双方更新状态。十轮后,Q-BOT必须猜测出正确的图片。

实验表明,通过强化学习训练的机器人表现优于传统的监督学习机器人。有趣的是,虽然监督学习的Q-BOT试图模仿人类提问,但强化学习的Q-BOT改变了策略,提出A-BOT更擅长回答的问题,从而产生了更有价值的对话。

此外,另一种方法是使用对抗性损失或感知损失来区分人类回答和机器生成的回答。Facebook人工智能研究院和佐治亚理工学院的研究人员将在NIPS 2017会议上展示他们的研究成果,题为“Best of Both Worlds: Transferring Knowledge from Discriminative Learning to a Generative Visual Dialog Model”。此外,德国马普信息学研究所、加州大学伯克利分校和Facebook人工智能研究院的研究人员也在研究如何在同一时间生成多张图片描述,以使模型生成更多样化和拟人的图片描述。

我们需要开放的跨领域合作

作为人类,我们大脑的重要功能之一是通过视觉处理信息,而自然语言是我们交流的主要方式。创造一种能够将视觉和语言结合起来的人工智能系统是一项既令人兴奋又充满挑战的任务。本文探讨了两个关键研究方向:明确的视觉推理和拟人化的视觉对话。虽然我们在不断进步,但仍有许多挑战等待解决。为了确保持续的进步和创新,保持Facebook人工智能研究院、学术界及整个AI生态系统的长期开放合作至关重要。

本文来源: 图灵汇 文章作者: 吃瓜群众