滴滴开源自然言语了解模型训练平台 DELTA

图灵汇官网

7月28日至8月2日,自然语言处理领域顶级会议ACL2019在意大利佛罗伦萨举行,滴滴在会议上正式宣布开源名为DELTA的深度学习语音和自然语言理解模型训练平台。DELTA旨在帮助AI开发者更轻松地创建和部署自然语言处理及语音模型,促进实际应用的实现。

自然语言处理模型和语音模型作为众多AI系统与用户互动的关键接口,其重要性不言而喻。滴滴此次开源的深度学习模型训练框架DELTA,意在简化自然语言处理系统和语音模型的开发过程。DELTA是滴滴推出的第22个开源项目,主要基于TensorFlow构建,能够同时支持自然语言处理任务、语音任务以及数值特征的训练。

滴滴在自然语言处理和语音技术方面积累了丰富的经验,希望通过开源DELTA将其技术能力开放给更多开发者。DELTA针对工业应用场景进行了特别优化,旨在弥补从算法模型到实际应用之间的空白。DELTA集成了文本分类、命名实体识别、自然语言推理、问答、序列到序列文本生成、语音识别、说话人验证和语音情感识别等多种算法模型,形成了统一的代码结构和接口。

使用DELTA,开发者只需准备模型训练所需的数据,并设置好配置参数,DELTA就会根据这些参数进行数据处理,选择合适的任务和模型进行训练。训练完成后,DELTA会自动生成模型文件并保存。这些模型文件具有统一接口,可以直接用于产品部署,从而加快从研究到应用的速度。

DELTA的研发团队指出,该平台优化了文本和语音特征及数据处理模块,使开发者能够专注于提供数据,而无需担心预处理步骤。此外,DELTA还提供了多种序列建模方法,特别适用于自然语言处理和语音识别任务。

DELTA不仅支持多种模型的训练,还具备高度的灵活性和可配置性,允许开发者构建复杂的模型组合。DELTA在多个常见任务上提供了稳定且高效的基准测试,使得用户可以快速复现论文中的模型效果,并在此基础上扩展新模型。完成模型构建后,用户可以通过DELTA提供的部署工具快速上线模型,实现从理论到实践的无缝对接。

截至目前,尚未发现与DELTA完全相同的开源项目。大多数现有的开源项目主要用于研究目的,而DELTA则同时服务于学术界和工业界,支持自然语言处理和语音任务,以及数值特征的训练。DELTA的独特之处在于它能够处理多模态数据,这在实际应用中非常常见。

有兴趣的AI开发者可以在GitHub上找到DELTA的详细介绍和源代码,利用DELTA加速实验进程,部署用于文本分类、命名实体识别、自然语言推理、问答、序列到序列文本生成、语音识别、说话人验证和语音情感识别等任务的系统。用户还可以访问滴滴的开源平台,了解更多滴滴的开源项目详情。

本文来源: 图灵汇 文章作者: 策测解金