计算机诞生后不久,英国工程师布斯(A.D.Booth)和美国工程师韦弗(W.Weaver)率先提出利用计算机进行自动翻译的概念。然而,早期机器翻译系统的粗糙设计导致了翻译质量低下,这使得一些人对机器翻译的研究失去了信心。甚至有人错误地认为全自动高质量的机器翻译是不可能实现的,这导致了机器翻译研究陷入低谷。
尽管面临诸多挑战,法国、日本和加拿大等国家仍坚持进行机器翻译的研究。到了20世纪70年代初,机器翻译研究出现了复苏。研究人员逐渐认识到,机器翻译过程中需要保持源语言和目标语言在语义上的一致性,从而推动了语义分析在机器翻译中的重要性。
繁荣期的主要特点是机器翻译研究走向实用化,涌现了大量的实用型机器翻译系统,机器翻译产品开始进入市场,逐步实现了商业化。第二代机器翻译系统主要采用了基于转换的方法,广泛运用句法分析和辅助的语义分析,采用分层完成策略。
针对目标句子,进行多种句法分析,如分词、词性标注、命名实体识别、链接、句法结构分析、语义角色标注和多义词消歧等。
从目标文本中提取关键信息,如新闻报道中的关键事件,主要包括人物、时间、地点、行为及其结果等。涉及实体识别、时间抽取、因果关系抽取等技术。
主要包括文本聚类、分类、信息抽取、摘要生成、情感分析等,以及对挖掘出的信息和知识进行可视化和交互式展示。
将输入的源语言文本通过自动化翻译转换为目标语言文本。从最初的基于规则的方法,到二十年前的基于统计的方法,再到如今基于深度学习(编码-解码)的方法,机器翻译已经形成了一套较为完善的方法体系。
对大规模文档进行索引,可以通过简单的词汇加权方法建立索引,也可以使用复杂的算法建立深层次的索引。查询时,首先对输入进行分析,然后在索引中查找匹配的候选文档,并根据排序机制输出最佳结果。
针对自然语言问题,提供精准答案。需要对自然语言查询进行语义分析,包括实体链接和关系识别,形成逻辑表达式,然后从知识库中找到可能的答案并按排序机制输出最佳答案。
系统通过多轮对话与用户互动,完成特定任务,主要涉及用户意图识别、通用聊天引擎、问答引擎和对话管理系统等技术。为了体现上下文相关性和个性化,对话系统还需要具备多轮对话能力和基于用户画像的个性化回复功能。
语料库是记录语言实际使用情况的真实语料集合,是基于计算机承载的语言知识基础资源。真实语料需要经过加工(分析和处理),才能成为有用的研究资源。