MuQ-VocalScore-KTV-Ablation (KTV重录高分数据消融实验)
⚠️ 注意 / Disclaimer:
本项目为**负向优化(Negative Result)**实验记录。在 MuQ 歌唱打分模型的训练中,我们尝试引入“KTV重录原唱数据”作为高分段样本,但导致了模型发生“捷径学习(Shortcut Learning)”。本仓库记录了该实验过程与结论,以供参考。
📖 实验背景与目标 (Background)
- 任务: 歌唱质量打分(Vocal Scoring / Singing Evaluation)。
- 基础模型: MuQ。
- 数据痛点: 早期训练数据(纯KTV用户真实录音)多集中在 50-85 分的低分/中分段,缺乏 85-99 分的高水平演唱数据。
- 实验方案: 将专业原唱分离出的纯人声,在真实 KTV 包厢环境中用麦克风重新录制(并刻意加入人声闲聊、碰杯声、麦克风底噪),赋予 85-99 的高分标签,混合到原有的低分段真实用户数据中进行训练。
🔍 为什么效果变差? (Failure Analysis)
经过全量测试与切片测试,我们发现模型并未学到“歌唱审美”,而是学到了声学特征的分类捷径:
- 捷径学习 (Shortcut Learning): 模型敏锐地捕捉到了“真实KTV用户录音”与“原唱外放重录录音”在声学底噪、混响及频段上的微小差异。
- 虚高的验证指标 (Illusory Performance): 在混合测试集上,Pearson 相关系数一度高达 0.78 - 0.86。模型实际上只是在做二分类:区分哪些是原唱重录(给高分),哪些是普通用户(给低分)。
- 真实场景崩溃 (Real-world Degradation): 当我们将测试集严格限制为 纯KTV真实用户录音(即实际部署场景,Unseen Testset) 时,Pearson 相关系数断崖式下跌至 0.39 甚至更低,说明模型内部的分数评判逻辑(内部准确率)实际上非常差。
💡 最终结论 (Conclusion)
- 试图用“环境模拟重录”来弥补高分段数据分布的方法,在本场景下是失效的。
- 最佳实践: 放弃这批重录的合成高分数据。在我们的最终对比中,仅使用原始的 KTV 用户真实数据,从头开始做直接回归训练(Regression),在纯 KTV 测试集上反而能达到最优的真实泛化效果(最高 Pearson 为 0.51)。
本仓库保留了该实验分支的 checkpoints 与验证表格,仅供学术探讨与模型 DEBUG 参考。实际生产环境请参考仅基于真实数据训练的版本。