由 NCMMSC 2025 组委会发起,清华大学、北京邮电大学、海天瑞声、语音之家共同主办的第三届中文连续视觉语音识别挑战赛 CNVSRC 2025 即日启动,诚邀参与报名。

 

视觉语音识别,也称唇语识别,是一项通过口唇动作来推断发音内容的技术。该技术在公共安全、助老助残、视频验真等领域具有重要应用。当前,唇语识别的研究方兴未艾,虽然在独立词、短语等识别上取得了长足进展,但在大词表连续识别方面仍面临巨大挑战。特别是对于中文而言,由于缺乏相应的数据资源,该领域的研究进展受到了限制。为此,清华大学在2023年发布了 CN-CVS 数据集[1],成为首个大规模的中文视觉语音识别数据库,为进一步推动大词表连续视觉语音识别 (LVCVSR) 提供了可能。关于 CN-CVS 数据集的更多信息,可访问数据库官网 http://cnceleb.org 。

 

为了进一步推动这一研究方向的发展。清华大学语音与语言技术中心(CSLT)联合北京邮电大学、北京海天瑞声科技股份有限公司以及语音之家,于2023年启动了首届中文连续视觉语音识别挑战赛(CNVSRC 2023)[2],并于次年继续举办了CNVSRC 2024 [3]。参赛者们贡献了许多新的思路和技术,极大地推进了这一方向在中文领域的发展。

 

而本次赛事CNVSRC 2025 延续了对视觉信息处理的研究焦点,并将作为 NCMMSC 2025 会议的一项特别活动。与CNVSRC 2023和CNVSRC 2024相比,CNVSRC 2025具有两个重要变化:(1)引入了一个新的视觉到语音(VTS)赛道;(2)为了支持大规模模型,额外发布1000小时的训练数据。组织方为参赛者提供了基线代码以供参考。CNVSRC 2025的竞赛结果将在NCMMSC 2025会议上公布并颁奖。​​​​​​​