首页 » 软件开发 » CNVSRC 2023 中文连续视觉语音识别挑战赛正式发布(数据赛道清华大学说话参赛者)

CNVSRC 2023 中文连续视觉语音识别挑战赛正式发布(数据赛道清华大学说话参赛者)

雨夜梧桐 2024-07-24 08:20:58 0

扫一扫用手机浏览

文章目录 [+]

为推动这一研究方向的发展,由清华大学、北京邮电大学、海天瑞声、语音之家联合举办2023 NCMMSC特殊议题:中文连续视觉语音识别挑战赛(CNVSRC, Chinese Continuous Visual Speech Recognition Challenge)正式对外发布。
本次赛事以 CN-CVS 中文视觉语音识别数据库为基础数据,评估在录音室朗读 (Reading) 和网络演讲 (Speech) 两类场景下的 LVCVSR 系统的性能。
比赛结果将在 NCMMSC 2023 会议上宣布并颁奖。

01 数据集

• CN-CVS: CN-CVS包含2557名说话人超过300小时的音视频数据,覆盖播报与公开演讲场景,是目前最大的开源中文音视频数据集。
主办方为本次竞赛提供了该数据库的文本标注。
更多关于CN-CVS的信息请访问数据库官网http://www.cnceleb.org/。
该数据集作为本次竞赛闭集任务的训练集。

CNVSRC 2023 中文连续视觉语音识别挑战赛正式发布(数据赛道清华大学说话参赛者) 软件开发
(图片来自网络侵删)

• CNVSRC-Single: CNVSRC2023单人大数据。
包含一名说话人超过100小时的音视频数据,数据来源于网络视频,其中十分之九的数据构成开发集,剩余十分之一的数据作为测试集。

• CNVSRC-Multi: CNVSRC2023多人限量数据。
包含43名说话人的音视频数据,每人的数据量接近1小时,其中每个人的三分之二数据构成开发集,剩余数据构成测试集。
其中23名说话人的数据来源于受控环境下朗读固定机位录制,且单条数据时长相对较短。
另20名说话人的数据来源于网络的演讲视频,单条数据时长较长,环境和内容较为复杂。

对于训练集和开发集,主办方提供音频、视频和对应的转录文本;对于测试集,则仅提供视频数据。
参赛者不得以任何方式使用测试集,包括但不限于使用测试集帮助模型训练或者微调等。

数据集

CNVSRC-Single

CNVSRC-Multi

开发集 Dev

测试集 Eval

开发集 Dev

测试集 Eval

视频条数

25947

2881

20450

10269

视频时长(小时)

94.00

8.41

29.24

14.49

注:CNVSRC-Multi中的朗读数据来自海天瑞声赠与清华大学的【中文普通话音视频识别库(手机)】数据集。
海天瑞声(网址:www.dataoceanai.com)向清华大学赠与数据集,以促进科学事业发展。

02 任务设置

CNVSRC 2023 设计特定说话人视觉语音识别(T1)和多说话人视觉语音识别(T2) 两个任务,前者关注对某一特定说话人进行大数据调优后的性能,后者关注系统对非特定说话人的基础性能。
每一任务又分为“固定赛道”和“开放赛道”,其中固定赛道只能使用组委会约定的数据和其它资源,开放赛道可使用除测试集外的任意资源。

固定赛道中不能使用的资源包括:作为特征提取的非公开性预训练模型,超过1B参数或非公开的预训练语言模型。
可使用的工具和资源包括:人脸检测、提取、口唇区域提取、轮廓提取等公开可获得的预处理工具;用于数据增强的公开可获得的外生模型及工具、数据集;公开的词表、发音词典、n-gram语言模型、小于1B参数的神经语言模型。

固定赛道

开放赛道

T1: 特定说话人唇语识别

CN-CVS, CNVSRC-Single 开发集

任意数据、工具

T2: 多说话人唇语语别

CN-CVS, CNVSRC-Multi 开发集

任意数据、工具

03 参赛方式

参赛者需在CNCeleb官网上注册CNVSRC账号,请访问如下网址进行注册:

http://cnceleb.org/competition

注册以后,用户可以依据提示下载数据资源(CN-CVS, CNVSRC-Single, CNVSRC-Multi)。

CNVSRC 2023 以字错误率(Character Error Rate, CER)为评测准则。
结果提交时,参赛者需要登录CNVSRC账号,进入CNVSRC 2023结果提交页面,选择对应的任务和赛道,提交结果文件。
结果文件中每一行对应一条测试视频,以该视频的ID开始,后接对应的转录文本。
内容提交后,系统自动计算CER并显示给参赛者。
对每个任务每个赛道,参赛者有5次提交机会。

04 基线系统

主办方提供了固定赛道条件下多说话人和特定说话人两个任务的基线系统供。
该基线系统采用基于Conformer的结构,模型性能如下。

Task

Single-speaker VSR

Multi-speaker VSR

CER on Dev Set

48.57%

58.77%

CER on Eval Set

48.60%

58.37%

参赛者可以通过下面网址获得基线系统的代码:https://github.com/MKT-Dataoceanai/CNVSRC2023Baseline

05 赛程安排

时间

议程

2023/09/20

开启报名,训练数据集、开发数据集、基线系统发布

2023/10/10

测试数据集发布

2023/11/01

提交系统开放

2023/12/01 晚12点

提交结果截止

2023/12/09

NCMMSC 2023 Workshop,公布成绩、优秀竞赛方案分享

06 组委会

姓名

单位

王东

清华大学

陈琛

清华大学

李蓝天

北京邮电大学

李科

海天瑞声

卜辉

语音之家

标签:

相关文章

语言中的借用,文化交融的桥梁

自古以来,人类社会的交流与发展离不开语言的传播。在漫长的历史长河中,各民族、各地区之间的文化相互碰撞、交融,产生了许多独特的语言现...

软件开发 2025-01-01 阅读1 评论0

机顶盒协议,守护数字生活的新卫士

随着科技的飞速发展,数字家庭逐渐走进千家万户。在这个时代,机顶盒成为了连接我们与丰富多彩的数字世界的重要桥梁。而机顶盒协议,作为保...

软件开发 2025-01-01 阅读1 评论0

语言基础在现代社会的重要性及方法步骤

语言是人类沟通的桥梁,是社会发展的基础。语言基础作为语言学习的基石,对于个人、社会乃至国家的发展具有重要意义。本文将从语言基础在现...

软件开发 2025-01-01 阅读2 评论0

粤语电影,传承文化,点亮时代之光

粤语电影,作为中国电影产业的一朵奇葩,以其独特的地域特色、丰富的文化内涵和鲜明的艺术风格,赢得了广大观众的喜爱。本文将从粤语电影的...

软件开发 2025-01-01 阅读3 评论0

苹果游戏语言,塑造未来娱乐体验的基石

随着科技的飞速发展,游戏产业逐渐成为全球娱乐市场的重要支柱。在我国,游戏产业更是蓬勃发展,吸引了无数玩家和投资者的目光。而在这其中...

软件开发 2025-01-01 阅读1 评论0