Fine-tuned
nvidia/canary-qwen-2.5b on the UWB-ATCC corpus for Air Traffic Control speech recognition using LoRA adaptation.
1from nemo.collections.speechlm2.models import SALM
2import torch
3
4model = SALM.from_pretrained('nvidia/canary-qwen-2.5b')
5state = torch.load('consolidated_model.pt', map_location='cpu')
6model.load_state_dict(state, strict=False)
7model.cuda().eval()
8
9answer_ids = model.generate(
10 prompts=[[{
11 'role': 'user',
12 'content': f'Transcribe the following: {model.audio_locator_tag}',
13 'audio': ['atc_audio.wav']
14 }]],
15 max_new_tokens=128,
16)
17print(model.tokenizer.ids_to_text(answer_ids[0].cpu()))
Pilot-to-ATC Research — Comparative evaluation of W2V2 vs Canary-Qwen for ATC domain ASR.