Mae'r set data yma wedi ei gynhyrchu drwy torri recordiadau maint arferol ac/neu hir o
Common Voice 18 , i darnau llai drwy defnyddio model
'Voice Activity Detection (VAD)'. Er enghraifft, gall recordiad o frawddeg fel "Ffotograffau a darluniau du-a-gwyn." cael ei thorri i dair
recordiad byr: "Ffotograffau", "a darluniau", "du-a-gwyn".
Defnyddwyd yn benodol split train_missing,
sef recordiadau o frawddegau set hyfforddi swyddogol Common… See the full description on the dataset page:
https://huggingface.co/datasets/techiaith/commonvoice_vad_cy.