← 返回竞赛经历AI 竞赛 / 科大讯飞 AI 开发者大赛

Datawhale 2026 夏季实训:多模态语音识别

记录科大讯飞 AI 开发者大赛 基于用户注册信息的关键词检测挑战赛学习记录

SUBMISSION TIMELINE

Datawhale 2026 夏季实训:多模态语音识别

科大讯飞 AI 开发者大赛 · RMSE · 分数越高越好

3
提交次数
0.69190
最佳 RMSE
0.64456
最新 RMSE
+0.06624
相对首提交提升
  1. 第一次提交

    0.62566

    提交 submission1.csv,提交baseline

    平台已返回分数,作为后续实验的对照结果。
  2. 第三次提交

    0.69190+0.06624

    提交 submission2.csv,修改epochs为20,调整正负样本权重为0.5,并且使用全量数据集

    得分再次上涨
  3. 第二次提交

    0.64456-0.04734

    提交 submission2.csv,修改epochs为20

    得分比第一次高,修改了训练轮次之后有明显进步

这次实践来自 Datawhale 2026 夏季实训多模态语音识别赛道,

赛题任务

基于语音注册的关键词检测任务,需要根据注册语音作为先验,自适应的识别测试音频中同文本的关键词。本次大赛提供了多人“文本-语音”配对的关键词作为训练样本,参赛选手需基于提供的样本构建模型,并使用测试集的关键词注册语音,预测关键词测试语音是否与注册语音文本相同。

训练数据:任何开源训练集(含噪声集)均可使用,但须注明来源。

外部模型:允许使用开源模型权重进行特征提取(如 whisper 等); 严格禁止使用任何开源模型权重或 API 直接参与关键词检测判决,开源模型的输出必须服务于训练选手自己的模型

测试:测试集声学场景大致涵盖 -10 ~ 5 dB,将加入部分发音相似词(如 hi <–> haier)以模拟设备误唤醒痛点。

评估方式

比赛使用均方根误差(RMSE)评估预测结果,数值越低越好。其计算方式可写为 RMSE = sqrt((1 / n) × Σ(yᵢ - ŷᵢ)²)

RMSE 与预测目标使用相同量纲,同时会对较大的预测误差给予更高惩罚。因此,判断实验是否有效时应比较相同提交阶段的 RMSE,而不是把更高的数值理解为更好的成绩。

提交记录

提交时间 文件名 平台评分(RMSE) 相对第一次提交
2026-07-16 13:21:33 submission1.csv 0.62566 baseline
2026-07-21 12:58:52 submission2.csv 0.64456 提交 submission2.csv,修改epochs为20
2026-07-21 15:49:23 submission3.csv 0.6919 调整正负样本权重为0.5,并且使用全量数据集
2026-07-19 16:23:33 submission4.csv 2

当前复盘