Mirror non-officiel du Corpus d'Études du Français Contemporain (CEFC)
agrégé par le projet Orfeo (ANR), tel que distribué sur le portail
projet-orfeo.fr (release 13).
Long-form : 1 row = 1 fichier audio entier (30-60 min en moyenne).
12 sous-corpus oraux du français contemporain, 303 heures au total,
901 fichiers. Idéal pour bench Whisper / Canary en conditions réelles
(chunked decoding, dérive temporelle, multi-locuteurs).… See the full description on the dataset page:
https://huggingface.co/datasets/ggfox00000/stt-cefc-fr-test.