中文读唇总动员:CNVSRC 2024 研讨会将于本周五开幕

文摘   科技   2024-08-12 14:01   日本  

CNVSRC 2024 (Chinese Continuous Visual Speech Recognition Challenge 2024) 是由 NCMMSC 2024 组委会发起,由清华大学、北京邮电大学、海天瑞声、语音之家联合承办的视觉语音识别竞赛。本次竞赛的核心目的是验证当前视觉语音识别 (或称唇语识别) 技术在大词表连续识别场景下的性能。目前竞赛结果提交系统已经关闭,参赛队伍排名已经确定。


本次竞赛吸引了学术界和工业界多家单位参与,一些团队的提交结果远超基线系统,取得了优异成绩。8月16日本周五上午10:00,CNVSRC 2024 组委会将在 NCMMSC 2024 上举办研讨会,宣布竞赛排名,并邀请部分参赛团队分享技术细节。研讨会采用线上线下混合模式,主会场在乌鲁木齐明园新时代大酒店(人文韬厅 )线上腾讯会议号为:338-578-844,或扫描下方二维码直接入会。






视觉语音识别

视觉语音识别,也称唇语识别,是一项通过口唇动作来推断发音内容的技术。该技术在公共安全、助老助残、视频验真等领域具有重要应用。当前,唇语识别的研究方兴未艾,虽然在独立词、短语等识别上取得了长足进展,但在大词表连续识别方面仍面临巨大挑战。特别是对于中文而言,由于缺乏相应的数据资源,该领域的研究进展受到了限制。为此,清华大学在2023年发布了 CN-CVS 数据集[1],成为首个大规模的中文视觉语音识别数据库,为进一步推动大词表连续视觉语音识别 (LVCVSR) 提供了可能。并在同年举办了 CNVSRC 2023[2],推动了唇语识别在中文领域的进展。


为了进一步推动这一研究方向的发展,清华大学联合北京邮电大学、海天瑞声和语音之家决定在 NCMMSC 2024 继续举办中文连续视觉语音识别挑战赛 (Chinese Continuous Visual Speech Recognition Challenge 2024, CNVSRC 2024)。本次赛事以 CN-CVS 中文视觉语音识别数据库为基础数据,评估在录音室朗读 (Reading) 和网络演讲  (Speech) 两类场景下的 LVCVSR 系统的性能。除此之外,本届竞赛还额外提供了 CN-CVS2-P1 数据集以供选手们使用。比赛结果将在 NCMMSC 2024 会议上宣布并颁奖。




赛事简介



CNVSRC 2024 共设有两个任务:

  • T1:特定说话人视觉语音识别 (Single-speaker VSR) 

  • T2:多个说话人视觉语音识别 (Multi-speaker VSR)

前者侧重于针对某一特定说话人进行大量数据调优后的性能,后者侧重于系统对非特定说话人的基础性能。每个任务根据训练数据不同,又分为固定赛道 (Fixed Track) 和开放赛道 (Open Track)。

固定赛道仅允许使用 CN-CVS 数据集及各任务发布的开发集作为训练集,旨在验证算法的先进性。开放赛道则可以使用任何数据进行训练,旨在验证当前技术能够达到的性能上限。




CNVSRC 2024 时间表




CNVSRC 2024 时间安排如下:

05月08日   报名系统开放

05月08日   数据集发布

05月08日   基线系统发布

07月01日   结果提交系统开放

08月01日   结果和系统技术描述提交截止

08月16日   举办 CNVSRC 2024 Workshop,竞赛结果发布


[1] C. Chen, D. Wang, T.F. Zheng, CN-CVS: A Mandarin Audio-Visual Dataset for Large Vocabulary Continuous Visual to Speech SynthesisICASSP, 2023.

[2] C. Chen, Z. LiuX. Li, L. Li, D. Wang, CNVSRC 2023: The First Chinese Continuous Visual Speech Recognition Challenge, INTERSPEECH, 2024.

清语赋
清华大学语音语言团队 (CSLT) 科研学术分享和日常生活百态
 最新文章