第二届CCF先进音频技术大赛正式启幕!延续首届赛事丰硕成效与发展势能,本届大赛继续以培养音频领域人才、支持学生科技创新、选拔优秀力量为目标。大赛由中国计算机学会主办,CCF语音对话与听觉专委会承办、语音之家协办,华为终端有限公司独家赞助,聚焦大模型时代音频技术热点,为高校及科研院所相关专业学子,搭建交流竞技、展示提升的优质平台。
竞赛试题
赛题一:音乐修复
1. 赛题背景
当音乐通过扩音设备播放出来,由于喇叭本身的失真(如手机喇叭播出来的音乐低频损失,鼓声无力)、多喇叭发声的混响感(如演唱会场景),会让录制该场景的音乐音质下降,需要音乐修复(Music Restoration)技术来提升音乐音质。
2. 赛题内容
(1)劣质扩音设备失真修复:音乐信号经由劣质扩音设备播放后,再通过麦克风录制。由于扩音设备性能受限,录制信号相较于原始音乐存在明显质量退化,包括非线性失真、背景噪声增强以及频率响应不均衡等问题。参赛系统需要对录制音频进行修复,以提升其音质和听感。
(2)多喇叭扩音混响修复:同一音乐信号通过多个扬声器同时播放,并由麦克风进行录制。由于多路径传播和声学叠加效应,录制音频通常包含较强的混响和失真,导致声音发糊、清晰度下降。参赛系统需要有效抑制混响及相关失真,恢复更清晰、更自然的音乐音频。
3. 数据集与基线系统
竞赛组织方将提供约10小时的配对训练数据。为覆盖真实场景中的声学条件差异,数据集在以下维度具有丰富的多样性:
- (1)扬声器维度:涵盖多种型号、不同数量以及不同摆放距离的扬声器配置;
- (2)场景维度:覆盖典型声学环境,包括室内家居、餐厅、会议室,以及户外广场、公园等场景;
- (3)音乐维度:涵盖不同音乐风格、乐器编制及录音内容,以增强任务的泛化性和挑战性。
此外,竞赛组织方将提供基线模型及完整的训练和推理代码,供参赛者快速开展研究与开发。我们鼓励参赛者复现并超越基线系统的性能,共同推动相关技术的发展。
4. 关键交付件
初赛:
参赛队伍提供可执行的模型文件,在赛事官方指定环境中进行测试。
参赛队伍需提交方案复杂度和可实现性的文档,文档包括模型运行输出的日志文件,数据说明、参数量、复杂度以及是否满足因果性的分析和说明文件。
复赛:
最终方案的技术报告和答辩材料(含算法原理、方案设计、创新性、各个模型对结果的作用分析等)。
5. 评分规则
初赛:组委会通过业界常用客观评测方案对参赛队伍结果进行客观评分(SI-SNR*X、FAD*X、谱距离、ViSQOL),排序取前7名进决赛;所有队伍需要提供可执行模型;
复赛:算法处理结果占比40%;方案创新性占比30%;方案的复杂度和可实现性占比30%。
| 一级指标 | 二级指标 | 要求 | 对应分值 |
|---|---|---|---|
| 客观打分 | 客观指标 | 增强后音频的SI-SNR打分,占比25%,根据初赛所有参赛队伍实际提交结果划分客观打分等级 | 10 |
| 增强后音频的FAD打分,占比25%,根据初赛所有参赛队伍实际提交结果划分客观打分等级 | 10 | ||
| 增强后音频的谱距离,占比25%,根据初赛所有参赛队伍实际提交结果划分客观打分等级 | 10 | ||
| 增强后音频的ViSQOL,占比25%,根据初赛所有参赛队伍实际提交结果划分客观打分等级 | 10 | ||
| 复杂度 | 重点考察算法的参数量(M)和复杂度(MFlops),占比2/3 参数量:< 5M:10分; 5M~10M:8分; 10M~15M:6分; 15M~20M:5分; > 20M:4分 复杂度:< 500MFlops:10分; 500~2000MFlops:8分; 2000~5000MFlops:6分; 5000~10000MFlops:5分; > 10000MFlops:4分 |
20 | |
| 主观打分 | 方案创新性 | 在算法原理或者方案实践上有原创性进展;20~30分 在算法原理或者方案实践上基于现有方法有优化;0~20分 |
30 |
| 听感评估(MOS) | 对音频进行Overall MOS评分,并对所有结果进行排序,分为四级,评分如下:1级10分,2级8分,3级6分,4级4分 | 10 |
手机喇叭播放后被麦克录制的信号 vs 原始音源,音质差异大
赛题二:通用音频分离
演唱会场景多喇叭扩音被麦克录制的信号 vs 扩音前原始音源,音质差异大
1. 赛题背景
前馈与反馈相结合的混合主动降噪模式,已在主动降噪领域得到广泛应用。随着应用场景日益复杂、噪声类型更加多样,传统降噪方法在适应性和稳定性方面面临新的挑战。因此,面向复杂场景和多样化噪声样本,发展自适应降噪与 AI 降噪技术,有助于进一步提升主动降噪系统的综合性能和用户体验。
2. 赛题内容
(1)基于对主动噪声控制(ANC)系统原理的理解,采用AI方法设计轻量级神经网络,实现端到端的主动降噪控制,在保证模型计算效率和部署可行性的基础上,尽可能提升系统的降噪效果。
(2)在实际应用中,主动噪声控制系统的传递函数会受到环境变化的显著影响。例如,在主动降噪耳机中,不同佩戴者的耳道结构、佩戴松紧程度以及耳机位置变化,都会导致声学传递函数发生较大变化,从而影响降噪效果。因此,本研究希望参赛者设计的 AI 模型不仅能够在特定环境下实现良好的降噪性能,还应具备较强的泛化能力,能够适应不同的 ANC 声学环境。需要特别说明的是,所部署的模型必须采用离线推断方式工作,即模型在实际运行过程中不允许进行在线训练或在线参数更新。
ANC简化架构示意图
AI-ANC实现框架示意图
3. 数据集与基线系统
竞赛方将提供如下数据:
- 原始参考噪声:麦克风采集的原始环境噪声(16-bit WAV,原生 48kHz)。
- 期望噪声:噪声经过未知初级路径衰减后到达误差麦克风的声音。
- 次级路径:扬声器到误差麦克风的物理冲激响应(已做空间平均并降采样至 48kHz)。
竞赛组织方将提供一个基线模型及其完整的训练和推理代码,鼓励复现我们公布的baseline的结果。
4. 关键交附件
初赛:
参赛队伍提供可执行的模型文件,在赛事官方指定环境中进行测试。
参赛队伍需提交方案复杂度和可实现性的文档,文档包括模型运行输出的日志文件,数据说明、参数量、复杂度以及是否满足因果性的分析和说明文件。
复赛:
最终方案的技术报告和答辩材料(含算法原理、方案设计、创新性、各个模型对结果的作用分析等)。
5. 评分规则
初赛:组委会通过业界常用客观评测方案对参赛队伍结果进行客观评分,排序取前7名进入决赛;所有队伍需要提供可执行模型。
复赛:算法处理结果占比40%;方案创新性(如ANC架构、自适应算法、先进滤波器结构等)占比30%;方案的复杂度和可实现性占比30%。
| 一级指标 | 二级指标 | 要求 | 对应分值 |
|---|---|---|---|
| 客观打分 | 客观指标 | 按照50-5kHz的1/3倍频程统计ANC降噪量,占比70%,根据初赛所有参赛队伍实际提交结果划分客观打分等级 | 28 |
| 按照1k-8kHz的1/3倍频程统计ANC反弹,占比30%,根据初赛所有参赛队伍实际提交结果划分客观打分等级 | 12 | ||
| 复杂度 | 重点考察算法的参数量(M)和复杂度(MFlops),占比2/3 参数量:< 5M:10分; 5M~10M:8分; 0M~15M:6分; 15M~20M:5分, >20M:4分 复杂度:< 500MFlops:10分; 500~2000MFlops:8分; 2000~5000MFlops:6分; 5000~10000MFlops:5分; >10000MFlops:4分 |
20 | |
| 主观打分 | 方案创新性 | 在算法原理或者方案实践上有原创性进展;20~30分 在算法原理或者方案实践上基于现有方法有优化;0~20分 |
30 |
| 听感评估(MOS) | 对音频进行Overall MOS评分,并对所有结果进行排序,分为四级,评分如下:1级10分,2级8分,3级6分,4级4分 | 10 |
2026年CCF先进音频技术竞赛 Website
参赛报名
大赛面向国内高等院校及科研院所在读学生 (含全日制本科生、硕士研究生、博士研究生)
*每支参赛团队人数为1-5人,只限1位老师指导完成。
*本届大赛各获奖队伍需要在第21届全国人机语音通讯学术会议(NCMMSC2026)的赛事特殊议题上以论文形式提交参赛技术方案说明,入选的论文会邀请在大会赛事特殊议题报告上作分享展示。具体会议时间与投稿要求另行通知。
微信公众号
联系我们
商务合作:bd@aishelldata.com
技术服务:tech@aishelldata.com
联系电话:+86-010-80225006
公司地址:
北京市海淀区海淀大悦信息科技园D5-A501
开源数据
