Speaker Recognition (SRE) speech dataset, packed as WebDataset tar shards.
data/
train/
metadata.csv
audio/
train-000.tar
train-001.tar
...
validation/
metadata.csv
audio/
validation-000.tar
...
test/
metadata.csv
audio/
test-000.tar
...
Inside each tar, every sample is a pair sharing a unique key:
.wav # raw audio bytes… See the full description on the dataset page: https://huggingface.co/datasets/Yougen/said_testset.