Views
No views yet
japanese-zipformer-base-k2-rs35kh-bpetransformers library:1import librosa
2import numpy as np
3from transformers import AutoProcessor, AutoModelForCTC
4
5model = AutoModelForCTC.from_pretrained(
6 "reazon-research/japanese-zipformer-base-k2-rs35kh",
7 torch_dtype=torch.bfloat16,
8 trust_remote_code=True,
9).to("cuda")
10processor = AutoProcessor.from_pretrained("reazon-research/japanese-zipformer-base-k2-rs35kh")
11
12audio, _ = librosa.load(audio_filepath, sr=16_000)
13audio = np.pad(audio, pad_width=int(0.5 * 16_000)) # Recommend to pad audio before inference
14input_values = processor(
15 audio,
16 return_tensors="pt",
17 sampling_rate=16_000
18).input_values.to("cuda").to(torch.bfloat16)
19
20with torch.inference_mode():
21 logits = model(input_values).logits.cpu()
22predicted_ids = torch.argmax(logits, dim=-1)[0]
23transcription = processor.decode(predicted_ids, skip_special_tokens=True).removeprefix("▁")| Model | #Prameters⬇ | AVERAGE⬇ | JSUT-BASIC5000⬇ | Common Voice⬇ | TEDxJP-10K⬇ |
|---|---|---|---|---|---|
| reazon-research/japanese-wav2vec2-large-rs35kh | 319M | 16.25% | 11.00% | 18.23% | 19.53% |
| reazon-research/japanese-wav2vec2-base-rs35kh | 96.7M | 20.40% | 13.22% | 23.76% | 24.23% |
| reazon-research/japanese-zipformer-base-k2-rs35kh | 96.5M | 11.26% | 9.71% | 11.00% | 13.07% |
| reazon-research/japanese-zipformer-base-k2-rs35kh-bpe | 96.5M | 11.46% | 9.88% | 11.02% | 13.48% |
| reazon-research/japanese-hubert-base-k2-rs35kh | 98.4M | 11.23% | 9.94% | 11.59% | 12.18% |
| reazon-research/japanese-hubert-base-k2-rs35kh-bpe | 98.4M | 11.07% | 9.76% | 11.36% | 12.10% |
| Model | #Prameters⬇ | JSUT-BOOK⬇ |
|---|---|---|
| reazon-research/japanese-wav2vec2-large-rs35kh | 319M | 30.98% |
| reazon-research/japanese-wav2vec2-base-rs35kh | 96.7M | 82.84% |
| reazon-research/japanese-zipformer-base-k2-rs35kh | 96.5M | ❌ |
| + Silero VAD | 20.80% | |
| reazon-research/japanese-zipformer-base-k2-rs35kh-bpe | 96.5M | ❌ |
| + Silero VAD | 21.51% | |
| reazon-research/japanese-hubert-base-k2-rs35kh | 98.4M | 27.05% |
| + Silero VAD | 19.59% | |
| reazon-research/japanese-hubert-base-k2-rs35kh-bpe | 98.4M | 84.55% |
| + Silero VAD | 19.34% |
1@misc{japanese-zipformer-base-k2-rs35kh,
2 title={japanese-zipformer-base-k2-rs35kh},
3 author={Sasaki, Yuta},
4 url = {https://huggingface.co/reazon-research/japanese-zipformer-base-k2-rs35kh},
5 year = {2025}
6}
7
8@article{yang2024k2ssl,
9 title={k2SSL: A faster and better framework for self-supervised speech representation learning},
10 author={Yang, Yifan and Zhuo, Jianheng and Jin, Zengrui and Ma, Ziyang and Yang, Xiaoyu and Yao, Zengwei and Guo, Liyong and Kang, Wei and Kuang, Fangjun and Lin, Long and others},
11 journal={arXiv preprint arXiv:2411.17100},
12 year={2024}
13}