校园大数据如何有效应用?如何通过技术手段服务校园?为此,我们采访了卓智大数据产品总监林帅兵,他分享了他的见解。
在校园内实施大数据产品时,我们广泛采用了自然语言处理技术。最初,我们并未充分重视这些细节,因为网络上有许多现成的“分词词库”和“情感词库”,调用它们就能获得满意的结果。然而,随着时间推移,我们逐渐发现,这些词库并不能完全满足校园场景下的需求。例如,机器经常遗漏关键信息,且在理解某些语境时会出现误判,如“A食堂比B食堂贵,所以我选择这家”这类简单的逻辑,机器却无法理解。
因此,我们专注于研究符合校园特点的自然语言处理技术,使机器能够更好地理解和捕捉校园语境下的细微差别。我们主要依靠摩尔定律、深度学习和数学模型等基础理论,来推动这一进程。而这一切的基础,就是校园大数据。
借助校园大数据,尤其是言论数据,我们建立了相应的模型,通过大量数据分析,提炼出校园特有的词汇库,用于分词。例如,在校园环境中,考研与升学、挂科与不及格被视为近义词,因为它们在数学算法中更接近。
在研究符合校园特点的“文本语义理解系统”过程中,我们遇到了诸多挑战。这些挑战往往隐藏在看似简单的问题背后,解决起来却异常复杂。为了使机器更好地理解语言,我们从字、词、句、文四个层面构建模型,克服重重困难,最终形成了独特的自然语言处理技术。
首先,我们需要解决“分词”的问题
例如,“卓智人工智能研究院”可以分解为“卓智”、“人工智能”、“研究院”,但实际操作中,机器可能会将其分解为“智人”、“人工”、“智能”、“研究院”。这涉及到分词颗粒度、部分本义、同义词、指代归属及上下文依赖等问题。
在校园环境中,我们举几个简单的例子来说明: - 颗粒度:卓智大数据研究院/大数据/研究院 - 部分本义:金融风暴“洗礼”/美元持续“疲软” - 同义近义词:考研=升学、挂科=不及格 - 上下文依赖:什么意思,小意思,我方便一下 - 指代归属:北京大学=北大=我校
为了适应校园语境,我们构建了符合校园特点的词汇库,并通过反复测试来优化分词结果。
其次,我们需要理解“语义”
例如: - 范畴感知理解:在工程专业,“仪表”代表“仪表设备”,而在日常生活中,“仪表”则指人的外貌。 - 省略、双关、反讽、假借、暗喻:如“你觉得可以?”这句话,结合标点符号应理解为“不可以”。 - 歧义句理解:如“限量签名网球拍卖了”,究竟是网球“拍卖”,还是“网球拍”卖了。
为了解决这些特定语境下的歧义问题,我们根据不同专业领域、言论发表场景,增加了词库权重,从而提高了理解准确性。
第三,构建校园知识图谱
知识图谱对于理解校园内的自然语言至关重要。例如,“张主任”可能指代多个部门,这就需要了解说话人的从属关系。具体来说: - 实体抽取:包括人名、专业名词、课程名称、法规等。 - 关系抽取:如目的关联、动作关联、从属关联等。 - 属性抽取:如时间、型号、班级、电话号码等。
基于知识图谱,机器可以更准确地判断“张主任”指的是哪个部门的张主任。
第四,逐层理解语义
在处理“脱敏工具”时,我们发现文章中出现高敏感词汇并不意味着文章整体是负面的,反之亦然。为了应对这一挑战,我们让机器分层理解: - 词层面:分析词汇之间的关系。 - 句法层面:分析句子结构和短语关系。 - 最终层面:根据权重理解整篇文章。
第五,为校园场景定制语言模型
此外,我们还开发了一套词库管理工具,让学校可以自主添加敏感词并标出敏感度。但仅靠词库和词典的传统方法效果有限,所以我们开始研究机器对新样本的适应能力,让机器具备“触类旁通”的能力,从而不断提高模型的泛化能力和效果,使机器更加精准地理解校园内的自然语言。
我们致力于不断提高1%的准确度,以期在校园语言分析中取得更好成果。