Facebook正在不断发展其自然语言处理(NLP)框架,以应对快速实验和大规模部署的挑战。PyText是一个基于PyTorch的开源深度学习框架库。
为了帮助开发者构建和部署NLP系统,Facebook决定开源PyText框架,并分享其预训练模型和教程。Facebook表示,借助PyText,开发者可以实现更快的实验、大规模文本处理和词汇管理,并利用PyTorch生态系统构建预先构建的模型和工具。
在官方博客中,Facebook提到:“在Facebook,我们使用这个框架可以在几天内(而不是几周或几个月)将NLP模型从概念阶段推进到完全完成,并部署依赖多任务学习的复杂模型。目前,在Facebook上每天都有超过10亿次的预测使用PyText,这证明了它能够在生产环境中运行,并满足严格的延迟要求。”
Facebook解释说,传统上,研究人员和工程师需要在为实验设计的框架和为生产设计的框架之间做出选择。对于NLP系统来说尤其如此,因为这可能需要创建、训练和测试数十个模型,并使用动态结构。面向研究的框架可以提供简单、易用的界面,加速高级和动态模型的开发过程,但也可能导致生产环境中的延迟和内存消耗增加。
得益于PyTorch 1.0的强大功能,PyText可以通过一个统一的框架解决研究和生产的问题。PyText将PyTorch 1.0的强大性能引入自然语言处理领域,提供了包括在AI社区内不同组织间共享模型的能力、预构建的常用NLP任务模型(如文本分类和语言建模),以及上下文模型以提高对话理解能力。
Facebook计划在其解决方案中使用这一框架,提供强大的功能,如执行翻译和改善产品体验。未来,该公司还计划支持设备上的模型处理端到端的工作流程,并提供多语言建模及其他建模功能,以便调试和优化分布式训练。