本文根据小米智能云秦斌老师在DataFunTalk人工智能技术沙龙“自然语言处理技术应用实践”中的分享《音乐垂域的自然语言理解》编辑整理而成,旨在保留原意的前提下进行适当的删减。
今天分享的主要内容包括项目的研究背景、实现的功能以及在音乐领域所面临的问题和挑战。此外,还详细介绍了“小爱”项目的具体实施情况。
小爱语音交互平台的后台服务架构主要包括多个模块,小米大脑作为平台的核心,能够处理各种数据,并通过封装SDK接口来简化厂商的接入流程。为了提高语音识别的效率和准确性,该平台整合了多种ASR技术,包括微软、百度、科大讯飞等厂商提供的服务。语音转化为文本后,进入自然语言处理(NLP)模块进行进一步处理。NLP模块通过个人训练计划、公共训练计划以及query概率等方式,将数据发布到不同的垂直领域。整个系统还包括一个设备开放平台(oivs),方便硬件设备厂商接入。此外,还有一个技能开放平台,使得第三方开发者能够轻松创建新技能,如成语接龙或闲聊等。
在音乐垂域,系统需要理解用户的意图,并抽取相关字段。例如,在处理飞机票查询时,系统需要区分购票和退票的需求;而在音乐领域,则需要识别用户是想要找歌手、听歌还是获得推荐。抽取的字段包括时间、出发地、目的地等,这有助于将纯文本信息结构化,从而更好地理解和处理用户需求。
音乐垂域实现的功能包括个性化推荐、搜索意图、上下文继承、用户情感分析、播放顺序指定、根据歌词内容识别歌曲以及播放历史歌曲等。这些功能大大提升了用户体验。然而,在实际操作过程中也遇到了一些挑战,如实体名复杂、用户说法多样、实体名纠错困难等。为了应对这些问题,采用了知识库加搜索的方法,并利用搜索引擎的技术优势来解决这些问题。
知识库中包含大量的实体信息,这些信息需要通过爬取和合作的方式获取,并进行去重和清理。为了提高搜索效率,系统采用了Linden搜索引擎,该引擎基于开源的Lucene包,提供了集群管理和类似SQL语言的支持,使得搜索更加高效。此外,还通过learn to rank算法对搜索结果进行重排,以提高搜索的准确性和用户满意度。
在数据处理方面,系统通过对query进行预分析、数据预处理、中文分词和推荐意图分类器等步骤,进一步提高了搜索的准确性和用户体验。此外,还利用文法规则和标签文法等方法,对query语义进行倾向性判断,以更好地满足用户需求。
为了提升搜索和推荐的准确性,系统采用了多种机器学习算法,如逻辑回归、Word2vec、LamdaMart等。这些算法通过对用户行为数据的学习,提高了搜索和推荐的准确性。同时,系统还通过全领域知识反馈模型,利用用户点击信息和用户行为特征,进一步优化了搜索结果。
尽管系统已经取得了一定的成果,但仍存在一些问题,如音乐slot抽取准确性不足、知识库准确性和完整性有待提高等。未来的工作将继续致力于解决这些问题,以进一步提升系统的性能和用户体验。