Views
No views yet
1from transformers import AutoFeatureExtractor, AutoModel, AutoTokenizer
2import librosa
3
4model_id = "mesolitica/gemma3n-audio-encoder-VQ-65k-whisper-decoder"
5feature_extractor = AutoFeatureExtractor.from_pretrained(model_id)
6model = AutoModel.from_pretrained(model_id, trust_remote_code = True, torch_dtype = 'auto').cuda()
7encoder = model.model.get_encoder()
8y, sr = librosa.load('218757.mp3', sr = feature_extractor.sampling_rate)
9features = feature_extractor([y], return_tensors = 'pt')
10features['input_features'] = features['input_features'].cuda()
11features['input_features_mask'] = features['input_features_mask'].cuda()
12_, tokens = encoder(**features)
13print(tokens)tensor([ 910, 32677, 16546, 53781, 27314, 15398, 31002, 5847, 28410, 7585,
53632, 47416, 38022, 6021, 48561, 20577, 29356, 16390, 6384, 7237,
53567, 15756, 52487, 12716, 218, 27008, 25496, 27415, 14668, 41049,
25329, 8556, 27467, 56087, 2976, 46430, 46014, 13764, 11178, 34157,
11391, 46160, 46693, 14112, 23788, 2958, 15187, 37938, 60867, 20024,
25597, 36378, 39933, 23820, 2392, 18068, 8010, 17651, 5731, 4433,
40480, 30643, 55976, 46888, 60327, 53716, 30826, 26525, 11720, 7492,
26675, 28757, 10368, 10900, 31609, 32883, 59085, 34244, 215, 43827,
5471, 26865, 26593], device='cuda:0')1from transformers import AutoFeatureExtractor, AutoModel, AutoTokenizer
2import librosa
3
4model_id = "mesolitica/gemma3n-audio-encoder-VQ-65k-whisper-decoder"
5feature_extractor = AutoFeatureExtractor.from_pretrained(model_id)
6model = AutoModel.from_pretrained(model_id, trust_remote_code = True, torch_dtype = 'auto').cuda()
7tokenizer = AutoTokenizer.from_pretrained(model_id)
8
9y, sr = librosa.load('common_voice_ba_26517811.mp3', sr = feature_extractor.sampling_rate)
10input_ids = tokenizer(
11 '<|startoftranscript|><|ru|><|transcribe|><|notimestamps|>',
12 add_special_tokens = False, return_tensors = 'pt')['input_ids']
13features = feature_extractor([y], return_tensors = 'pt')
14features['input_features'] = features['input_features'].cuda()
15features['input_features_mask'] = features['input_features_mask'].cuda()
16features['attention_mask'] = features['input_features_mask']
17features['decoder_input_ids'] = input_ids.cuda()
18
19generate_kwargs = dict(
20 **features,
21 max_new_tokens=1024,
22)
23generation_output = model.generate(**generate_kwargs)
24tokenizer.decode(generation_output[0])<|startoftranscript|><|ru|><|transcribe|><|notimestamps|> Купыкта был широкое глобка шляпше на битапсы.<|endoftext|><|startoftranscript|><|{lang}|><|transcribe|><|notimestamps|>.