This dataset extends TTS-AGI/podcast-tokenized-bg3.5-enj5 with speaker embeddings, cosine similarity scores, speaker cluster assignments, and reference-match flags for each sample.
target_speaker_embedding
list[float] (128-dim)
L2-normalized speaker embedding of the target audio… See the full description on the dataset page:
https://huggingface.co/datasets/TTS-AGI/podcast-tokenized-bg3.5-enj5-with-speaker-embeddings.