Dataset Card for "Instruction Speech"
The largest open-source English speech instruction to text answer dataset
This dataset contains nearly 450,000 English speech instruction to text answer samples, using:
A subset of OpenHermes 2.5 with user's prompt length less than 64.
Audio generation using WhisperSpeech.
Tokenized using Encodec.
from datasets import load_dataset, Audio
Load Instruction Speech dataset