CNVSRC 2024 (Chinese Continuous Visual Speech Recognition Challenge 2024) 是由 NCMMSC 2024 组委会发起,由清华大学、北京邮电大学、海天瑞声、语音之家联合承办的第二届视觉语音识别竞赛。本次竞赛的核心目的是验证当前视觉语音识别 (或称唇语识别) 技术在大词表连续识别场景下的性能。即日起,CNVSRC 2024 组织者开放了提交系统和Leaderboard,竞赛正式进入实测阶段。
视觉语音识别,也称唇语识别,是一项通过口唇动作来推断发音内容的技术。该技术在公共安全、助老助残、视频验真等领域具有重要应用。当前,唇语识别的研究方兴未艾,虽然在独立词、短语等识别上取得了长足进展,但在大词表连续识别方面仍面临巨大挑战。特别是对于中文而言,由于缺乏相应的数据资源,该领域的研究进展受到了限制。为此,清华大学在2023年发布了 CN-CVS 数据集[1],成为首个大规模的中文视觉语音识别数据库,为进一步推动大词表连续视觉语音识别 (LVCVSR) 提供了可能。关于 CN-CVS 数据集的更多信息,可访问数据库官网 http://cnceleb.org 。
为推动这一研究方向的发展,清华大学联合北京邮电大学、海天瑞声和语音之家将在 NCMMSC 2024 举办第二届中文连续视觉语音识别挑战赛 (CNVSRC 2024, Chinese Continuous Visual Speech Recognition Challenge)。本次赛事以 CN-CVS 中文视觉语音识别数据库为基础数据,评估在录音室朗读 (Reading) 和网络演讲 (Speech) 两类场景下的 LVCVSR 系统的性能。比赛结果将在 NCMMSC 2024 会议上宣布并颁奖。
相较于第一届 CNVSRC 2023,本届 CNVSRC 2024 提供了更强大的固定赛道基线系统以及可用于开放赛道的额外数据集 CN-CVS2-P1。
赛事简介
CNVSRC 2024 共设有两个任务:
T1:特定说话人视觉语音识别 (Single-speaker VSR)
T2:多个说话人视觉语音识别 (Multi-speaker VSR)
前者侧重于针对某一特定说话人进行大量数据调优后的性能,后者侧重于系统对非特定说话人的基础性能。每个任务根据训练数据不同,又分为固定赛道 (Fixed Track) 和开放赛道 (Open Track)。
固定赛道仅允许使用 CN-CVS 数据集即各任务发布的开发集作为训练集,旨在验证算法的先进性。开放赛道则可以使用任何数据进行训练(例如,CN-CVS2-P1),旨在验证当前技术能够达到的性能上限。清华大学提供固定赛道上的基线系统代码,供参赛者作为参考。
CNVSRC 2024 时间安排如下:
05月08日 数据集发布
05月08日 基线系统发布
07月01日 结果提交系统开放
08月01日 结果和系统技术描述提交截止
08月15日 举办 CNVSRC 2024 Workshop,竞赛结果发布
参赛方式
CNVSRC 2024 对所有个人和单位免费开放,并允许参赛者在结果展示中选择匿名。在提交结果的同时,参赛队伍需以论文形式提交系统技术报告。赛事自报名系统开放后,现已有近30余支海内外队伍注册参赛。竞赛报名将持续到7月底,欢迎对视觉语音识别技术感兴趣的单位和个人参与。报名可扫如下二维码,或访问竞赛官网 http://cnceleb.org/competition。
[1] C. Chen, D. Wang, T.F. Zheng, CN-CVS: A Mandarin Audio-Visual Dataset for Large Vocabulary Continuous Visual to Speech Synthesis, ICASSP, 2023.