Views
No views yet
1# make sure espnet is installed: pip install espnet
2from espnet2.bin.s2t_inference import Speech2Text
3
4model = Speech2Text.from_pretrained(
5 "espnet/owls_1B_180K"
6)
7
8speech, rate = soundfile.read("speech.wav")
9speech = librosa.resample(speech, orig_sr=rate, target_sr=16000)
10# make sure 16k sampling rate
11
12text, *_ = model(speech)[0]| Model Name | Checkpoint | Training Artifacts |
|---|---|---|
| OWLS 0.25B 180K | https://huggingface.co/espnet/owls_025B_180K | TBA |
| OWLS 0.50B 180K | https://huggingface.co/espnet/owls_05B_180K | https://huggingface.co/espnet/owls_05B_180K_intermediates/tree/main |
| OWLS 1B 11K | TBA | TBA |
| OWLS 1B 22K | TBA | TBA |
| OWLS 1B 45K | TBA | TBA |
| OWLS 1B 90K | TBA | TBA |
| OWLS 1B 180K | https://huggingface.co/espnet/owls_1B_180K | TBA |
| OWLS 2B 180K | https://huggingface.co/espnet/owls_2B_180K | TBA |
| OWLS 4B 180K | https://huggingface.co/espnet/owls_4B_180K | https://huggingface.co/espnet/owls_4B_180K_intermediates |
| OWLS 9B 180K | https://huggingface.co/espnet/owls_9B_180K | https://huggingface.co/espnet/owls_9B_180K_intermediates |
| OWLS 18B 180K | https://huggingface.co/espnet/owls_18B_180K | TBA |
| OWLS 18B 360K | https://huggingface.co/espnet/owls_18B_360K | TBA |
@article{chen2025owls,
title={OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models},
author={Chen, William and Tian, Jinchuan and Peng, Yifan and Yan, Brian and Yang, Chao-Han Huck and Watanabe, Shinji},
journal={arXiv preprint arXiv:2502.10373},
year={2025}
}