过去60年间,人工智能经历了两次高潮与低谷。在第一个十年,人工智能主要应用于医疗、教育、信贷和金融等行业,利用大数据和机器学习迅速提升了效率和准确性。而在第二个十年,人工智能则转向了消费产品和日常生活场景,如无人驾驶汽车、智能家居和家用机器人等领域。这一转变也促使我们的交互方式发生了变化。
在特定的应用场景下,例如无人驾驶和智能家居,语音交互是最便捷的方式之一。语言作为人类独特的沟通方式,未来在人工智能领域将扮演重要角色,有望解放我们的双手。当前我们正处在语音智能产品快速发展的时期,需要一个系统性的归纳来帮助我们在语音交互和智能硬件领域共同探索和学习。本文将讨论关于语音界面设计的一些知识,主要观点来源于《语音用户界面设计——对话式体验设计原则》这本书,希望能对读者有所帮助。
20世纪90年代出现了交互式的语音应答系统(IVR),它能通过电话线路理解人们的语音并执行相应的操作。尽管这些系统广泛应用在客户服务中,但它们仅限于单轮任务的问答,且交互方式较为单一,不能中途打断。
随后,各大公司推出了各自的语音助手,如微软的Cortana、谷歌的Google Now和苹果的Siri。这些语音助手结合了视觉和语音信息,实现了多模态交互,支持多轮对话。然而,如何准确理解用户的语音仍然是一个技术挑战。
近年来,各家公司纷纷推出智能家居音箱,如亚马逊Echo和谷歌Home。这些设备专注于纯语音交互,未来在生活和工作中,语音交互将成为一种新的交互方式,人们可能会逐渐放弃屏幕和手势操作,转而通过语音控制设备。
首先,我们需要了解什么是VUI(Voice User Interface)。VUI设计不仅涵盖了普通互联网设计的要素,还涉及更广泛的领域。VUI设计师的工作包括用户研究、产品原型设计、交互行为描述及数据分析,最终目的是优化用户体验。此外,VUI设计师还需要考虑产品的类型和主要功能,无论是多模态产品还是纯语音设备,都需要通过示例对话来更好地理解产品和用户需求。
设计语音产品前,需要了解语音识别技术,包括ASR(自动语音识别)和NLU(自然语言理解)。目前,大多数VUI系统采用命令-控制模式,用户需先给予明确的指示。对话模式允许更自然的交流,但在某些情况下仍需明确的唤醒词。
优秀的VUI设计应确保用户感到被理解。设计确认策略时,需要考虑交互问答的错误后果、反馈方式、屏幕显示内容和用户确认手段。确认策略可分为显性和隐性两种形式。
显性确认通常需要用户明确回答,例如在支付场景中,用户需要回答“是”或“否”。
隐性确认则通过回复原始问题的方式来确认,例如Siri通过视觉列表和语言回复来确认问题。
对于移动设备,视觉确认是一种常见方式。系统会同时提供音频和视觉确认,例如通过屏幕上的可视化列表。
无需口头确认,通过行为反馈即可,例如灯光开启时无需语音提示。
VUI系统在说话时,用户可以打断。在多模态形式下,通常不允许打断,如Siri不支持打断对话。
异常情况处理在语音识别和指令场景中非常普遍,包括未检测到语音、语音终止超时、无语音超时、部分语音识别错误等。不同的异常情况需要不同的处理方式。
未来,语音交互将进一步发展,包括上下文语义理解、消除歧义、情感和情绪分析以及高级自然语言理解。这些技术将使语音助手更加智能和人性化,成为未来的重要发展方向。