Dataset Card for Saudilang Code-Switch Corpus (SCC)
Dataset Summary
The Saudilang Code-Switch Corpus (SCC) is a 5-hour transcribed audio dataset featuring informal Saudi Arabic speech with code-switching to English, sourced from the "Thmanyah" YouTube podcast. It was created for evaluating models in multilingual and dialectal speech settings, such as ASR, language identification, and code-switch detection.