← 返回竞赛经历AI 竞赛 / 科大讯飞 AI 开发者大赛

Datawhale 2026 夏季实训:多模态语音识别

记录关键词检测挑战赛的参赛阶段、提交策略、平台分数变化与赛后复盘。

SUBMISSION TIMELINE

Datawhale 2026 夏季实训:多模态语音识别

科大讯飞 AI 开发者大赛 · RMSE · 分数越高越好

3
提交次数
0.69190
最佳 RMSE
0.64456
最新 RMSE
+0.06624
相对首提交提升
  1. 第一次提交

    0.62566

    提交 submission1.csv,提交baseline

    平台已返回分数,作为后续实验的对照结果。
  2. 第三次提交

    0.69190+0.06624

    提交 submission2.csv,修改epochs为20,调整正负样本权重为0.5,并且使用全量数据集

    得分再次上涨
  3. 第二次提交

    0.64456-0.04734

    提交 submission2.csv,修改epochs为20

    得分比第一次高,修改了训练轮次之后有明显进步

这条记录只保留 Datawhale 2026 夏季实训多模态语音识别赛道的比赛信息、提交过程与结果;可复用的数据和特征方法另行整理到学习记录。

赛题任务

基于语音注册的关键词检测任务,需要根据注册语音作为先验,自适应的识别测试音频中同文本的关键词。本次大赛提供了多人“文本-语音”配对的关键词作为训练样本,参赛选手需基于提供的样本构建模型,并使用测试集的关键词注册语音,预测关键词测试语音是否与注册语音文本相同。

训练数据:任何开源训练集(含噪声集)均可使用,但须注明来源。

外部模型:允许使用开源模型权重进行特征提取(如 whisper 等); 严格禁止使用任何开源模型权重或 API 直接参与关键词检测判决,开源模型的输出必须服务于训练选手自己的模型

测试:测试集声学场景大致涵盖 -10 ~ 5 dB,将加入部分发音相似词(如 hi <–> haier)以模拟设备误唤醒痛点。

评估方式

比赛使用均方根误差(RMSE)评估预测结果,数值越低越好。其计算方式可写为 RMSE = sqrt((1 / n) × Σ(yᵢ - ŷᵢ)²)

RMSE 与预测目标使用相同量纲,同时会对较大的预测误差给予更高惩罚。因此,判断实验是否有效时应比较相同提交阶段的 RMSE,而不是把更高的数值理解为更好的成绩。

当前复盘