AI的“智慧”究竟有多高?通过一系列考试便可见一斑。
近日,人工智能企业云从科技与上海交通大学联合宣布,在自然语言处理(NLP)领域取得了重大突破,其在大型深度阅读理解任务数据集RACE上登顶榜首。这是在高中测试题部分首次超越人类的成绩。然而,紧随其后,微信AI也刷新了这一纪录。
为了展示自己的AI实力,多家科技或互联网公司纷纷加入了“考试大军”。其中,由卡耐基梅隆大学语言技术研究所发起的RACE数据集成为了各大AI公司的竞技场。
RACE数据集来源于中学考试题目,包含约2.8万篇文章和近10万个问题。其形式类似于英语考试中的阅读理解(选择题),即给定一篇文章,通过阅读并理解文章,从四个选项中选出正确答案。
这类题目的正确答案并非直接出现在文章中,而是需要从语义层面深入理解文章,通过分析文章中的线索并基于上下文进行推理。这意味着,AI不仅需要进行运算和记录,还需要主动分析和理解文章,包括篇章结构、逻辑关系、辅助语句和关键句等复杂的组织网络。
云从科技与上海交通大学基于原创DCMN算法,提出了一种全新的模型,使得机器阅读理解的正确率提高了4.2个百分点,并在高中测试题部分首次超越了人类(机器正确率69.8%,人类平均正确率69.4%)。
紧接着,微信AI宣布,其整体正确率达到了73.5%,全面超越了人类。尽管微信AI亮相较晚,但其实力不容小觑。截至目前,微信已先后推出了微信智聆和微信智言两大AI技术品牌,后者更专注于智能对话和自然语言处理等技术的研究与应用。此外,腾讯还专门成立了灵格实验室,专注于NLP领域的技术研发与应用探索。
AI系统与高考状元同场竞技
为了更全面地评估AI的能力,许多AI公司直接参与了各类考试。
去年12月,在合肥举办了一场特殊的六级考试,这场考试是专门为“机器人”设计的,考生是科大讯飞研发的一套智能翻译系统,考卷则是当年六级试卷中的三道翻译题,每题满分15分。智能翻译系统答题迅速,每题仅用5秒时间便完成了试卷。经专家评审后,这套系统的得分分别为14分、14分和12分,超过了大学生的平均分。
再来一场高考题的较量如何?2017年全国高考数学结束后,一场人机对决上演:在线教育公司“学霸君”自主研发的智能教育机器人“Aidam”首次亮相,与六位高考状元同台竞技全国卷文科数学试题。经过现场直播,Aidam完成了整张试卷,并按照评分标准得出最终成绩。
令人意外的是,这次AI并未完全“碾压”人类。阅卷结果显示,高考状元的得分分别为146分、140分和119分,而Aidam的得分是134分。
类似的案例并不罕见。今年2月,上海脑科学与类脑研究中心/张江实验室认知智能组与科大讯飞及复旦大学合作团队夺得了SAT(学术能力评估测试,俗称“美国高考”)数学成绩自动答题竞赛的世界冠军,成绩相当于360分(满分800分)。对于申请美国名校的中国考生来说,这个分数显得较为薄弱。对此,上海参赛团队负责人之一、上海脑科学与类脑研究中心研究员周熠表示,解答SAT试题尤其是综合题,需要突破自然语言和图像理解、知识表示和深度推理等多个难关,这对目前的弱人工智能而言仍然是巨大的挑战。“如果能让AI获得高分,将对技术发展产生重要影响。”
人机交互中AI难以理解人的意图
“阅读理解为后续的人机交互和对话提供了一次阶段性的验证。一直以来,自然语言理解的难度远高于语音和图像识别。”云从科技人工智能研究院副院长周翔表示,尽管计算机在测试题库上的表现良好,并不意味着其语言理解能力已经全面超越人类。
例如,在面对面交流时,即使中途接听电话,人们也能继续流畅地交流,而计算机的理解能力仍十分有限。此外,计算机在语言描述方面也存在理解困难,例如当询问是否有空闲时间进行沟通时,人们很容易理解背后的意思,但机器却难以分析。
周翔还指出,此次试题为英文,通常情况下中文比英文更为复杂。例如,英文单词通常只有一个意思,而中文词语之间没有空格,需要对名词、副词和形容词等进行分解,且中文存在多义词和歧义现象。
“自然语言理解的突破具有重要意义,既展示了各企业的技术实力,也表明自然语言处理领域仍有更多突破空间。”周翔说,随着自然语言理解的深入,人机交互将更加顺畅,尤其是机器能够更好地理解人的意图,比如未来出行时,只需对着手机说“我要出差”,机器就能理解主人何时出发、机票是否预订,并在遇到疑问时向主人提问,从而实现更多的互动。