让全世界拥有相通的语言始终是人们心中的梦想。随着人工智能技术的发展,机器翻译已经从最初的单词翻译发展到现在可以实现整句甚至整篇文章的翻译。尤其是一些便携式设备的出现,使得实时翻译成为可能。借助这些设备,即使身处陌生国度,看不懂文字,听不懂语言,也能通过机器翻译与他人进行交流和沟通,不再为语言障碍而烦恼。
自然语言处理是一种利用人工智能技术处理、理解和应用人类语言的方法。它体现了真正的“人工智能”。百度机器学习专家余凯曾表示:“听和看,其实连猫狗都能做到,只有语言才是人类独有的。”这意味着,只有当计算机具备处理自然语言的能力时,才算实现了真正的智能。
自然语言处理技术在日常生活中的应用非常广泛,包括机器翻译、手写体和印刷体字符识别、语音识别后的文字转换、信息检索、抽取与过滤、文本分类与聚类、舆情分析和观点挖掘等。这些应用分别运用了自然语言处理中的语法分析、语义分析和篇章理解等技术,是人工智能领域的前沿研究方向。如今,AI在这方面的进步已经将识别准确率从70%提升到了90%以上,但要达到99%以上的准确率,才能被视为自然语言处理技术达到了人类水平,这仍然是巨大的挑战。
自然语言处理的核心难题在于消除歧义。歧义问题主要体现在词法分析、句法分析和语义分析过程中,简称为消歧。正确的消歧需要大量的知识,包括语言学知识(如词汇、语法、语义和上下文)和常识。由于歧义的存在,自然语言处理面临着两大主要困难。
首先,语言中的大量歧义使得分词变得困难。同一种语言形式可能具有多种含义。特别是在处理中文时,由于中文词语之间缺少自然的分隔符,因此需要额外的步骤来确定词边界,即“中文自动分词”。简单来说,就是要让计算机自动在词语间添加分隔符,从而将中文文本切分为独立的词语。例如,“昨天有沙尘暴”这句话分词后为“昨天 | 有 | 沙尘暴”。自动分词是中文自然语言处理的基础,意味着它是理解语言的第一步,但正确的分词又依赖于对文本语义的准确理解。这就形成了一个“先有鸡还是先有蛋”的问题,成为自然语言处理的第一个难关。
除了在词语级别分词和理解存在难度外,在短语和句子级别也容易出现歧义。例如,“出口冰箱”既可以理解为动宾关系(从国内出口了一批冰箱),也可以理解为偏正关系(从国内出口的冰箱);同样,在句子级别,“做化疗的是她的妈妈”既可以理解为她妈妈生病了需要做化疗,也可以理解为她妈妈是医生,帮别人做化疗。
其次,消除歧义所需的知识在获取、表达和应用上存在困难。由于语言处理的复杂性,合适的自然语言处理方法和模型难以设计。
在理解一句话时,即使没有歧义问题,也需要考虑上下文的影响。所谓“上下文”指的是当前句子所处的语言环境,包括说话人的环境,或者是这句话的前几句或后几句等。例如,“小A打了小B,因此我惩罚了他”。在这句话中,“他”指的是小A还是小B?要正确理解这句话,就需要知道上一句“小A打了小B”意味着小A做错了事,因此第二句中的“他”应该指的是小A。由于上下文对当前句子的影响方式多样,如何考虑上下文的影响是自然语言处理中的一个重要难点。
此外,正确理解人类语言还需要足够的背景知识,特别是对成语和歇后语的理解。例如,在英语中,“The spirit is willing but the flesh is weak”是一句成语,意为“心有余而力不足”。然而,某些机器翻译系统将这句英文翻译成俄语,然后再翻译回英文时,却变成了“The Vodka is strong but the meat is rotten”,意为“伏特加酒很烈,但肉已腐烂”。这种错误的根本原因在于机器翻译系统缺乏对英语成语的理解,只是按字面意思进行翻译,结果导致了巨大的偏差。
自然语言处理就是利用人工智能技术处理、理解和应用人类语言。它在日常生活中有着广泛的应用,尤其是在机器翻译等领域,其准确率已经超过了90%,但要达到人类水平,仍然存在很大的挑战。
消除歧义是目前自然语言处理面临的最大难题,其根源在于人类语言的复杂性和语言描述世界的复杂性。人类语言承载着传递情感、交流思想和传播知识的重要功能,因此需要强大的灵活性和表达能力,而理解语言所需的知识又是无穷无尽的。那么,人们目前是如何尝试解决自然语言处理的问题的呢?
来源:"爱未客"