← 返回竞赛经历AI 竞赛 / 科大讯飞 AI 开发者大赛Datawhale 2026 夏季实训:多模态语音识别
记录科大讯飞 AI 开发者大赛 基于用户注册信息的关键词检测挑战赛学习记录
初赛实践#Datawhale · #科大讯飞 · #多模态 · #语音识别
- 3
- 提交次数
- 0.69190
- 最佳 RMSE
- 0.64456
- 最新 RMSE
- +0.06624
- 相对首提交提升
01
第一次提交
0.62566
提交 submission1.csv,提交baseline
平台已返回分数,作为后续实验的对照结果。02
第三次提交
0.69190+0.06624
提交 submission2.csv,修改epochs为20,调整正负样本权重为0.5,并且使用全量数据集
得分再次上涨03
第二次提交
0.64456-0.04734
提交 submission2.csv,修改epochs为20
得分比第一次高,修改了训练轮次之后有明显进步
这次实践来自 Datawhale 2026 夏季实训多模态语音识别赛道,
赛题任务
基于语音注册的关键词检测任务,需要根据注册语音作为先验,自适应的识别测试音频中同文本的关键词。本次大赛提供了多人“文本-语音”配对的关键词作为训练样本,参赛选手需基于提供的样本构建模型,并使用测试集的关键词注册语音,预测关键词测试语音是否与注册语音文本相同。
训练数据:任何开源训练集(含噪声集)均可使用,但须注明来源。
外部模型:允许使用开源模型权重进行特征提取(如 whisper 等); 严格禁止使用任何开源模型权重或 API 直接参与关键词检测判决,开源模型的输出必须服务于训练选手自己的模型
测试:测试集声学场景大致涵盖 -10 ~ 5 dB,将加入部分发音相似词(如 hi <–> haier)以模拟设备误唤醒痛点。
评估方式
比赛使用均方根误差(RMSE)评估预测结果,数值越低越好。其计算方式可写为 RMSE = sqrt((1 / n) × Σ(yᵢ - ŷᵢ)²)。
RMSE 与预测目标使用相同量纲,同时会对较大的预测误差给予更高惩罚。因此,判断实验是否有效时应比较相同提交阶段的 RMSE,而不是把更高的数值理解为更好的成绩。
提交记录
| 提交时间 |
文件名 |
平台评分(RMSE) |
相对第一次提交 |
| 2026-07-16 13:21:33 |
submission1.csv |
0.62566 |
baseline |
| 2026-07-21 12:58:52 |
submission2.csv |
0.64456 |
提交 submission2.csv,修改epochs为20 |
| 2026-07-21 15:49:23 |
submission3.csv |
0.6919 |
调整正负样本权重为0.5,并且使用全量数据集 |
| 2026-07-19 16:23:33 |
submission4.csv |
2 |
— |
当前复盘