CSM Clean 1M Multilingual v1 Adapter
Private LoRA adapter trained from sesame/csm-1b.
Run ID: csm_clean_1m_multilingual_v1
Data mix: 1,000,000 rows, 100,000 each for en,de,fr,es,it,pt,nl,pl,ja,tr from filtered YODAS2-Sidon speech.
Training: continued from csm_clean_context_multilingual_v9, 24,000 steps, LR 2e-6, batch 1, grad accumulation 8.
Known caveats:
- v1 learned Turkish and English better than several other languages.
- Final wrapper eval used refs in raw order, which over-conditioned many prompts on Italian/Spanish references; use same-language or no-reference eval controls for fair language checks.
- Dataset rows use
role: "0"; no real speaker-id conditioning is present in this adapter.