2026全球数字经济大会 | 希尔贝壳重磅亮相新产品首发专场
2026年7月3日,北京国家会议中心,在备受瞩目的2026全球数字经济大会——“人工智能融合应用发展论坛”上,希尔贝壳携手东南大学与天津理工大学,发布了“听觉障碍语音数据集”。

该论坛以“智驱实体,数创未来”为主题,汇聚了全球AI领域的顶尖专家与产业领袖。全国8家企业在本次论坛的“AI创新产品首发矩阵”环节亮相,共同展示了覆盖人工智能全栈生态的创新成果。希尔贝壳以唯一AI数据企业发布高质量数据集产品。

填补稀缺数据资源,聚焦“科技向善”
本次首发的听觉障碍语音数据集,是希尔贝壳“融声向善”数据生态建设的重要里程碑。该数据集专门面向中文聋人及听障群体,旨在解决当前语音技术在服务于特殊人群时面临的非典型语音数据严重不足的困境。
数据概览与核心特征
-
庞大规模与高质量录制:数据集已收录约200名受试者的语音,包含约13.8万条音频,总时长高达209.5小时。所有音频均采用行业标准的16kHz采样率及单声道格式录制。
-
精细化多维标注:每条音频均配有可对齐的标注文本。相比于常规语音库,该数据集标注了丰富的受试者背景信息(涵盖听力损失程度、听损发生时间、助听器/人工耳蜗使用情况、口语与手语能力、教育背景等关键变量),使得研究能够深入考察个体差异对语音识别效果的影响。
-
多层次任务支持:该资源不仅能支撑常规的自动语音识别(ASR)评估,还可服务于句级识别、关键词检出、语义相似度计算、错误类型分析乃至语音可懂度评价等高阶任务。

赋能研究与产业,推动公平AI落地
该数据集的发布,对于推动语音技术的普惠化具有重要实证价值。它为以下方向提供了坚实的数据基石:
-
模型性能评估与优化:支持ASR等模型在听障群体语音上的专项性能评估与调优,改善发音不标准带来的识别偏差。
-
个体差异与可懂度建模:借助详细的背景信息,研究人员可分析不同听力状况、设备使用及交流方式下的系统表现差异,并构建语音可懂度预测模型,以提升辅助沟通系统的效果。
-
隐私保护与数据安全:支持在保障隐私前提下的数据共享机制研究,推动安全、可控的数据协作模式。
在本次国家级行业大会上,希尔贝壳完成听觉障碍语音数据集全球首发。这套专属听障群体的数据集填补细分数据空白,为特殊人群辅助语音技术研发夯实基础。未来希尔贝壳将持续联动高校、科研院所与产业伙伴深化产学研协同攻关,持续打磨优质数据,完善安全可控的数据共享机制,持续优化面向特殊群体的普惠语音技术,以数据赋能,共建公平、多元、包容的下一代人工智能产业生态。
希尔贝壳,以人工智能民主化为目标
微信公众号
联系我们
商务合作:bd@aishelldata.com
技术服务:tech@aishelldata.com
联系电话:+86-010-80225006
公司地址:
北京市海淀区海淀大悦信息科技园D5-A501
开源数据
