← 返回竞赛经历AI 竞赛 / 科大讯飞 AI 开发者大赛Datawhale 2026 夏季实训:多模态语音识别
记录关键词检测挑战赛的参赛阶段、提交策略、平台分数变化与赛后复盘。
#Datawhale · #科大讯飞 · #多模态 · #语音识别
- 3
- 提交次数
- 0.69190
- 最佳 RMSE
- 0.64456
- 最新 RMSE
- +0.06624
- 相对首提交提升
01
第一次提交
0.62566
提交 submission1.csv,提交baseline
平台已返回分数,作为后续实验的对照结果。02
第三次提交
0.69190+0.06624
提交 submission2.csv,修改epochs为20,调整正负样本权重为0.5,并且使用全量数据集
得分再次上涨03
第二次提交
0.64456-0.04734
提交 submission2.csv,修改epochs为20
得分比第一次高,修改了训练轮次之后有明显进步
这条记录只保留 Datawhale 2026 夏季实训多模态语音识别赛道的比赛信息、提交过程与结果;可复用的数据和特征方法另行整理到学习记录。
赛题任务
基于语音注册的关键词检测任务,需要根据注册语音作为先验,自适应的识别测试音频中同文本的关键词。本次大赛提供了多人“文本-语音”配对的关键词作为训练样本,参赛选手需基于提供的样本构建模型,并使用测试集的关键词注册语音,预测关键词测试语音是否与注册语音文本相同。
训练数据:任何开源训练集(含噪声集)均可使用,但须注明来源。
外部模型:允许使用开源模型权重进行特征提取(如 whisper 等); 严格禁止使用任何开源模型权重或 API 直接参与关键词检测判决,开源模型的输出必须服务于训练选手自己的模型
测试:测试集声学场景大致涵盖 -10 ~ 5 dB,将加入部分发音相似词(如 hi <–> haier)以模拟设备误唤醒痛点。
评估方式
比赛使用均方根误差(RMSE)评估预测结果,数值越低越好。其计算方式可写为 RMSE = sqrt((1 / n) × Σ(yᵢ - ŷᵢ)²)。
RMSE 与预测目标使用相同量纲,同时会对较大的预测误差给予更高惩罚。因此,判断实验是否有效时应比较相同提交阶段的 RMSE,而不是把更高的数值理解为更好的成绩。
当前复盘