自从Siri问世以来,拟人化逐渐成为自然语言交互工具的重要特性。无论是面向消费者的智能语音助手,还是企业级的智能客服,甚至具备语音功能的家用电器,都在努力营造一种人格化的形象,似乎在一步步逼近“成精”的境界。
很多时候,我们认为拟人化能够减少用户的“恐惧谷效应”,使用户更愿意与其互动。然而,最新的研究显示,实际情况可能并非如此。
首先,拟人化的第一步就是为工具起一个充满亲和力的名字。通常,这些名字往往以“小”字开头,既显得亲切,又符合政治正确的趋势。
其次,通过语音合成技术模拟人类的语气。这一步骤需要超越简单的电子音,而是采用先进的神经网络技术,通过对人类说话方式的特征捕捉,使得语音听起来更自然、更有情感。
再次,对话内容也需要更加人性化。这意味着语义理解、多轮对话以及自然语言生成等技术的成熟度至关重要。例如,微软的小冰就采用了全双工自然语言交互技术,这种技术不仅能够理解用户的意图,还能适时地引导对话,使交互体验更加流畅。
最后,为了进一步拟人化,还可以为工具设计可爱的卡通形象,并加入一些讨喜的动作,使用户在交互过程中不易察觉到这是在与机器对话。
通过这些步骤,自然语言交互工具可以呈现出高度拟人的特征。
然而,我们从未深思过一个问题:在实际应用中,拟人化是否一定是最好的选择?宾夕法尼亚州立大学媒体效果研究实验室最近进行了一项实验,探讨了这个问题。
实验中,志愿者们被要求在电商平台上购买数码相机,并与在线客服进行沟通。这些客服背后实际上是智能自然语言交互系统,但它们在拟人化和响应速度方面有所不同。一部分客服直接告知用户它们是机器,另一部分则试图伪装成人类。同时,这些系统在响应速度上也有差异。
结果出乎意料。在相同的响应速度下,志愿者们对拟人化程度更高的客服满意度较低。当客服表现出较高的人性化特征时,用户对它们的期望也随之增加,一旦无法达到预期,失望感就会增强。相反,明确知道自己在与机器对话的用户反而给出了更高的满意度。
事实上,当我们使用自然语言交互工具时,常常会有类似的体验。如果语音助手或智能客服不能解决问题,还试图卖萌讲笑话,用户的满意度往往会下降。
总的来说,自然语言交互的拟人化与否实际上是一个“用户期望值管理”的问题。过度提升用户期望值可能会适得其反。
当前,自然语言交互工具在拟人性和工具性之间的发展并不均衡。从技术角度来看,让工具听起来像人类要比让工具更有效地解决问题容易得多。
无论是谷歌的WaveNet还是微软的全双工自然语言交互,都可以让工具的发音和对话节奏无限接近人类。未来,结合计算机视觉和机器人制造技术,我们甚至可以打造出与人类无异的对话者。
然而,这些工具在解决实际问题的能力上并没有显著提高。它们在理解人类语言、特别是小语种、老年语种和儿童语种方面仍然存在困难。此外,对于某些专业领域的术语,AI也经常陷入知识盲区。
因此,推动自然语言交互工具在“工具性”方面的进步,如构建各行业的知识图谱、扩充词汇库或收集不同人群的方言数据,将是未来一段时间内的重点。
随着技术的不断进步,人们对自然语言交互工具的期望值也在不断提高。为了避免“短板效应”,我们应该更加注重工具性的提升,而不是仅仅追求拟人性。