谷歌开放全新自然言语数据集:多元化场景更详细标注,让 AI 助手更懂人类

图灵汇官网

近日,谷歌宣布开放两个新的自然语言对话数据集,分别是Coached Conversational Preference Elicitation(CCPE)和Taskmaster-1。这些数据集旨在提供更贴近人类对话的详细标注数据,以便自然语言处理领域的研究者们能够获得更贴近实际生活的数据资源。

数据集背景

当前,智能助手已经能够在多个领域提供个性化的服务,如电影推荐、餐厅预订和旅行规划等。尽管近年来技术取得了显著进步,但智能助手仍然无法达到人类对话的理解水平。主要原因之一在于缺乏高质量的训练数据,这些数据能够准确反映人们在与智能助手互动时的真实需求和偏好。

因此,人们在与智能助手交流时,往往需要调整自己的表达方式,以适应助手的理解能力。这意味着现有的智能助手对话能力远远不能满足人类对话的复杂性需求。

更自然的对话数据集

为了解决这个问题,谷歌发布了CCPE和Taskmaster-1两个对话数据集。这两个数据集均采用了Wizard-of-Oz平台,该平台可以模拟真实的人机对话,使参与者在对话过程中能够更加自然地交流。

CCPE数据集

CCPE全称Coached Conversational Preference Elicitation,是一种获取用户偏好的新方法。该数据集通过分析对话来收集用户的电影偏好,共有超过500个对话,涵盖了10,000多个偏好描述。这些对话由两名专业人员通过自然语言进行交互,一名扮演“助手”,另一名扮演“用户”。助手会通过提问来引导用户表达自己的偏好,以减少偏见并获取自然的偏好表达。

Taskmaster-1数据集

Taskmaster-1数据集包括了13,215个基于任务的对话,其中7,708个是书面对话,5,507个是口语对话。这些对话覆盖了六个日常生活领域,包括订餐、汽车维修预约、租车、电影票预订、咖啡饮料购买和餐厅预订等。

Taskmaster-1数据集通过两种方式创建:一是“Wizard-of-Oz”方法,参与者在完成任务的过程中进行自然对话;二是“自我对话”方法,由单个参与者自行编写对话。这种方式不仅增加了对话的多样性和真实性,还降低了数据采集的成本。

数据集的应用价值

这些数据集对于研究者来说非常有用,它们能够帮助研究人员更好地理解和改善智能助手的对话能力。此外,这些数据集还可以用于评估和优化对话系统的表现,从而推动自然语言处理技术的发展。

更多关于这两个数据集的详细信息,可以通过以下链接查阅: - CCPE数据集 - Taskmaster-1数据集

希望这些数据集能为自然语言处理的研究提供有价值的参考。

本文来源: 图灵汇 文章作者: 光耀科技