Views
No views yet
1import torch
2from qwen_asr import Qwen3ASRModel
3
4model = Qwen3ASRModel.from_pretrained(
5 "Gearnode/qwen3-asr-uzbek-v2",
6 device_map="cuda:0",
7 dtype=torch.bfloat16,
8 attn_implementation="flash_attention_2",
9 max_new_tokens=448,
10 forced_aligner="Qwen/Qwen3-ForcedAligner-0.6B",
11 forced_aligner_kwargs=dict(dtype=torch.bfloat16, device_map="cuda:0"),
12)
13
14results = model.transcribe(
15 audio=[(audio_array, 16000)],
16 language=["Uzbek"],
17 return_time_stamps=True,
18)
19print(results[0].text)| Model | Uzbek Quality | Notes |
|---|---|---|
| This model | Best | Some repetition handled by post-processing |
| Meta MMS (mms-1b-all) | Passable | Use lang code uzb-script_latin |
| Whisper large-v3 | Poor | Hallucination loops on Uzbek |
| Base Qwen3-ASR | Poor | Mixed languages |