近期,全球计算机视觉领域的顶级盛事——CVPR 2024会议公布了第六届开放环境下情感行为分析国际挑战赛(ABAW6)的成绩。在这场汇集全球顶尖研究者与团队的比赛中,由于俊老师带领的中国科学技术大学信息学院自动化系与中国科技巨头云知声共同组建的团队,凭借卓越的技术实力,荣获人脸情绪识别(EXPR)、复合情绪识别(CE)、情绪模仿强度估计(EMI)三个关键赛道的季军。
CVPR会议作为IEEE主办的计算机视觉与模式识别领域旗舰级学术大会,不仅汇聚了全球领先的研究成果,也是全球计算机视觉领域三大顶级会议之一,备受业界瞩目。而ABAW赛事,则专注于开放环境下的情感行为分析,旨在推动技术在复杂多变场景中对人类情感的理解与应用,至今已成功举办六届,吸引了来自全球各地的知名高校、科研机构及企业参与。
在这次比赛中,中国科大-云知声联合团队以卓越的表现脱颖而出,不仅展现了在情感行为分析领域的深厚底蕴,也为后续研究奠定了坚实基础。基于此次比赛的成果,团队整理出一系列高质量的学术论文,并在CVPR workshop上进行了深入分享与交流。
情感行为分析作为一门跨学科领域,结合了视觉、听觉、文本等多种模态信息,旨在捕捉人类表情与情绪状态,深入理解人类内心世界,为情感识别、人机交互、心理健康等领域提供技术支持。这一领域的发展,对于提升人机交互的自然度与效率具有重要意义。
ABAW6赛事涵盖了面部表情分析的多个挑战项目,包括AU、EXPR和VA等传统赛道,以及今年新增的混合情绪识别(CE)与情绪模仿强度估计(EMI)两个创新赛道。CE赛道提供了未经标注的视频集合,挑战参赛者利用现有资源预测7种混合情绪;而EMI赛道则关注模仿者的情感强度估算,要求分析原始视频的情感表达强度。
针对比赛中遇到的挑战,研究团队采取了多项创新策略。例如,在EXPR赛道中,面对数据集规模有限的问题,团队采用半监督学习技术,通过生成表情类别的伪标签,扩充训练数据集,从而提高了模型的泛化能力和识别精度。此外,还通过引入去偏反馈学习策略,有效应对了数据集中的类别不平衡与潜在的数据偏差问题。
在CE赛道,研究团队提出了基于集成学习的方法,通过训练卷积网络、视觉Transformer和多尺度局部注意网络,综合考量局部和全局表情特征,显著提升了识别准确度,并展示了在部分区域实现零样本学习的能力。
针对EMI赛道的挑战,团队设计了一套基于ResNet18和面部动作单元(AUs)的双通道视觉特征提取策略,以及基于Wav2Vec2.0的单通道音频特征提取,成功构建了视听模态下的综合情感特征。通过后期融合策略,实现了视觉与声学模型预测的整合,更准确地估计了情感模仿强度。
此次比赛的成功,不仅体现了中国科大与云知声在情感行为分析领域的领先地位,也为后续研究提供了宝贵的经验与启示。展望未来,双方将持续深化合作,推动技术不断进步,共同构建更加智能、情感丰富的人机交互环境。
通过此次合作与竞赛,不仅展现了中国科大与云知声在计算机视觉与情感行为分析领域的卓越成就,也为推动相关领域技术发展、提升人机交互体验贡献了重要力量。随着未来研究的深入,双方有望在更多应用场景中实现技术创新与突破,共同开创智能时代的新篇章。