人工智能耳机:只需看一眼就能在人群中听清特定声音

图灵汇官网

改写原文

在创建宁静的聆听环境领域,降噪耳机取得了显著进展。然而,一个挑战在于如何让使用者能够有选择性地听到特定环境中的声音。以苹果的AirPods Pro为例,这款耳机能够根据环境自动调整音量(如在对话时),但用户无法控制想要倾听的对象以及何时启用降噪功能。

华盛顿大学的研究团队推出了一项创新技术——“目标语音聆听”(Target Speech Hearing)。此系统允许佩戴者通过注视特定说话人3至5秒来锁定该声音,从而实现消除周围噪音的功能,即使在嘈杂环境中移动或视线偏离说话人,也能持续播放锁定对象的声音。这一研究成果在5月14日的计算机-人类交互设计大会(ACM CHI)上展示,并提供了验证设备的源代码,鼓励其他开发者进一步探索。

资深作者Shyam Gollakota教授解释说:“人工智能通常被视为能解答问题的网络聊天机器人,但在本项目中,我们开发的技术则能够依据耳机使用者的偏好调整其听觉体验。借助我们的设备,即便身处喧闹之处,众多交谈声环绕,也能清晰聆听特定人士的声音。”

要使用这项系统,佩戴普通耳机并配备麦克风的用户只需在看向目标说话人时轻轻按下按钮。声波从说话人传至耳机两侧的麦克风,允许16度内的误差范围。随后,信号被发送到内置的嵌入式计算设备,经过团队的机器学习软件学习目标说话人的语音模式,系统将锁定该声音并持续播放给聆听者,无论其移动与否。随着说话人的持续发言,系统收集更多训练数据,进而提升聚焦锁定声音的能力。

研究团队进行了测试,发现21名参与者在使用该系统后,平均认为锁定声音的清晰度接近未经过滤音频的两倍。这项工作基于先前“语义聆听”的研究成果,该技术允许用户选择希望听到的特定声音类型(如鸟类鸣叫或人类语音),并消除了环境中的其他声音。

当前,TSH系统仅能锁定一个说话人,且需在目标说话人声音方向无显著噪音干扰的情况下进行锁定。若用户对声音质量不满意,可通过再次锁定说话人以增强清晰度。

研发团队正致力于将该技术拓展至耳塞和助听器等产品。

本文来源: 图灵汇 文章作者: 区块链资讯