Views
No views yet
amirhossein-yousefi/speech2text-intensity-regression-wav2vecfacebook/wav2vec2-base-960h (CTC) + attention‑masked mean pooling regressorfacebook/wav2vec2-base-960happ/gradio_app.py1python -m venv .venv
2source .venv/bin/activate # Windows: .venv\Scripts\activate
3pip install -r requirements.txtpython -m src.speech_mtl.training.train_whisper --model_name openai/whisper-small --language en --dataset librispeech_asr --train_split train.clean.100 --eval_split validation.clean --text_column text --num_train_epochs 1 --output_dir outputs/whisper_small_mtlpython -m src.speech_mtl.training.train_wav2vec2 --model_name facebook/wav2vec2-base-960h --dataset librispeech_asr --train_split train.clean.100 --eval_split validation.clean --text_column text --max_train_samples 1000 --max_eval_samples 150 --num_train_epochs 1 --output_dir outputs/wav2vec2_base_mtlpython -m src.speech_mtl.eval.evaluate --whisper_model_dir outputs/whisper_small_mtl --wav2vec2_model_dir outputs/wav2vec2_base_mtl --dataset librispeech_asr --split test.clean --text_column textpython -m src.speech_mtl.inference.predict --model whisper --checkpoint outputs/whisper_small_mtl --audio path/to/audio.wav1python app/gradio_app.py --model whisper --checkpoint outputs/whisper_small_mtl
2# or
3python app/gradio_app.py --model wav2vec2 --checkpoint outputs/wav2vec2_base_mtllibrispeech_asr (train.clean.100; eval on validation.clean / test.clean).mozilla-foundation/common_voice_13_0 via --dataset and --language.[-60, 0], then normalized to [0, 1]:norm_intensity = (dbfs + 60) / 60pyloudnorm) can be used as an alternative.configs/*.yaml.training-logs/ contains logs).test.clean by default; optionally Common Voice.11,971,980,681,992,470,0009,579.8516 seconds for 3 epochsrc/checkpoint/logsWER fromjiwer.wer(fraction in [0,1]; percent shown for readability).
This run uses a CTC objective for ASR and an auxiliary intensity head (multi‑task), but only ASR metrics were logged during evaluation.
| Metric | Value |
|---|---|
| Loss | 21.7842 |
| WER (↓) | 0.128966 (12.897%) |
| Runtime (s) | 158.5324 (≈ 2m 39s) |
| Samples / s | 17.050 |
| Steps / s | 4.264 |
| Epoch | 2.8 |
| Metric | Value |
|---|---|
| Train Loss | 227.4951 |
| Runtime (s) | 9,579.8514 (≈ 2h 39m 40s) |
| Samples / s | 8.937 |
| Steps / s | 0.559 |
| Epochs | 3.0 |
--lambda_intensity).transformers/datasets, Gradio.1@misc{yousefi2025speechmtl,
2 title = {Speech Multitask End-to-End (ASR + Intensity Regression)},
3 author = {Yousefi, Amirhossein},
4 year = {2025},
5 howpublished = {GitHub repository},
6 url = {https://github.com/amirhossein-yousefi/speech2text-intensity-regression-wav2vec}
7}configs/wav2vec2_base.yamlsagemaker/