Version: vFinal
A single-turn audio dataset with streaming chain-of-thought reasoning for SFT. 822 active training rows with audio references.
Top-level fields: id, split, modality, turn_type, audio, input, timestamps, streaming, target, taxonomy, quality, source, metadata
audio (path, reference, duration_sec, loadability)
input (text, instruction, length_bucket)
target (reasoning, answer, response)
streaming (checkpoints… See the full description on the dataset page:
https://huggingface.co/datasets/skyzhou06/LifeAudioSingleTurnStreamingCoT.