Source:
https://www.youtube.com/@visualaccent/videos
All rights belong to the original dataset creator.
We preprocessed the Visual Accent and Dialect Archive (
https://archive.mith.umd.edu/mith-2020/vada/index.html) for audio-visual speech recognition (AVSR), speech recognition (ASR), and visual speech recognition/lip-reading (VSR).
This version currently only contains read speech… See the full description on the dataset page:
https://huggingface.co/datasets/Berkeley-NLP/visual_accent_dialect_archive.