虚假语言:合成语言数据集的争议和价值

图灵汇官网

在人工智能领域,虚假语言数据集的作用一直备受争议。这些数据集,例如bAbI、CLEVR、Karthik的论文(arXiv:1506.08941)和DeepMind论文(arXiv:1710.09867),引发了诸多讨论。尽管这些数据集的结果表明各种学习架构可以“处理语言”,但这种说法却引发了自然语言处理(NLP)领域的不满。这不仅是因为长期以来的夸大宣传,还因为不同研究群体对“语言数据”概念的理解存在差异。

本文主要探讨指令遵循问题,但类似的状况也出现在问答、生成等其他接地任务中。本文不涉及对虚假语言数据进行语言学分析的工作,这类工作与语言本身无关,更多的是对特定模型类别的形式化表达能力进行分析,或是纯粹的垃圾数据。

在传统的AI研究视角中,指令遵循问题可以概括为:

语言 -> 抽象 -> 行为

然而,由于处理整个流程过于复杂,大部分研究是从不同的角度切入的。例如,“语言研究者”专注于:

语言 -> 抽象

这里的语言来自外部世界,无法控制其分布。研究者需要设计一种能够处理外部世界任意表达的抽象语言。语言学家通常采用逻辑形式提供精细的抽象表示,从抽象到行为的过程则被视为逻辑解释。因此,语言学家倾向于将抽象视为形式化语义,而“抽象 -> 行为”则被视为其他人的责任。

另一方面,“策略研究者”(如强化学习、规划和经典控制领域的研究人员)的工作则是:

抽象 -> 行为

在这个视角下,可接受的抽象范围取决于系统设计者。从“做10件事中的一件”到“满足STRIPS目标”,都可以被视为抽象语言。即使我们可以控制输入分布,这类问题依然具有挑战性。强化学习和规划都是复杂的任务,这些抽象语言的有趣组合性仍有待探索。构建抽象时所依据的分布和推导的行为是手工设计的,这里不存在语言数据。

近年来,这两个社区逐渐融合,因为世界变得更为综合:

语言 -> 行为

所有步骤都是端到端的。抽象并未消失,而是存在于一个不可解释的表示空间中,而不是之前手工设计的形式化系统。这是一个重大的变化。语言研究者不再局限于构建逻辑语言的世界,而策略研究者也不再依赖于特定的形式化系统描述任务,而是需要某种生成奖励函数/目标检验的方法。

对于策略研究者而言,明确标注所用的输入数据是合成数据非常重要。在这一点上,“语言”这个词已经被滥用,但“自然语言”尚未被滥用。除非涉及真人,否则应避免使用“自然”一词。

对于语言研究者而言,评估虚假语言数据集的标准应该是:“它是否解决了有趣的抽象 -> 行为问题?字符串是否以有趣的方式索引了目标行为类别?”这是一个合适的评价标准。

尽管如此,虚假语言数据集的研究仍有许多潜力,即便对那些只关注人类生成语言分布的人来说也是如此。

本文来源: 图灵汇 文章作者: 六六创意