Beta
Explore
Marketplace
Neural Labs
Chat
Wallet
Docs
tamil-combined – Dataset by Shubhangi7 | AlphaNeural AI
You can deploy this model and start earning money today!
Shubhangi7
/
tamil-combined
like
0
automatic-speech-recognition
ta
cc-by-4.0
100K<n<1M
parquet
audio
text
datasets
dask
polars
mlcroissant
us
Views
No views yet
Model card
Files and Versions
Community
API
tamil-combined
Combined and deduplicated Tamil ASR dataset (tamil1–tamil7). Audio resampled to 16 kHz mono WAV. Columns: text, audio.
Dataset details
Field Value
Parquet shards 61
Approx size 64.3 GB
Audio format 16 kHz mono WAV
Columns text, audio
Load
from datasets import load_dataset, Audio
ds = load_dataset("Shubhangi7/tamil-combined", split="train") ds = ds.cast_column("audio", Audio())