Views
No views yet
1from transformers import AutoModelForSpeechSeq2Seq, AutoProcessor, pipeline
2import torch
3
4model_id = "sbintuitions/kana-whisper"
5
6model = AutoModelForSpeechSeq2Seq.from_pretrained(
7 model_id,
8 torch_dtype=torch.float16,
9 low_cpu_mem_usage=True,
10 use_safetensors=True,
11).to("cuda")
12
13processor = AutoProcessor.from_pretrained(model_id)
14
15pipe = pipeline(
16 "automatic-speech-recognition",
17 model=model,
18 tokenizer=processor.tokenizer,
19 feature_extractor=processor.feature_extractor,
20 torch_dtype=torch.float16,
21 device="cuda",
22 generate_kwargs={"language": "ja", "task": "transcribe"},
23)
24
25result = pipe("path/to/audio.wav")
26print(result["text"])
27# Example output: "キョーワイイテンキデスネ"1@misc{liu2026sarashina22ttstacklingkanjipolyphony,
2 title={Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis},
3 author={Lianbo Liu and Shiao Zhu and Kai Washizaki and Reo Yoneyama and Haesung Jeon and Mengjie Zhao and Yusuke Fujita and Hao Shi and Nao Yoshida and Yuan Gao and Roman Koshkin and Yukiya Hono and Yui Sudo},
4 year={2026},
5 eprint={2606.25369},
6 archivePrefix={arXiv},
7 primaryClass={cs.SD},
8 url={https://arxiv.org/abs/2606.25369},
9}