Views
No views yet
1import requests
2import torch
3from torchvision import io
4from typing import Dict
5from transformers import Qwen2VLForConditionalGeneration, AutoTokenizer, AutoProcessor, AutoModel, SeamlessM4Tv2Model, AutoModelForCausalLM, AutoConfig
6
7
8model_path = "EastBrook/Qwen2.5-14B-SeamlessV2"
9#model_path = "./"
10model = AutoModelForCausalLM.from_pretrained(model_path, trust_remote_code=True, torch_dtype=torch.bfloat16).to("cuda")
11processor = AutoProcessor.from_pretrained(model_path, trust_remote_code=True)
12print("model_path: ", model_path)
13
14messages = [
15 {"role": "system", "content": "You are Qwen, created by Alibaba Cloud. You are a helpful assistant."},
16 {
17 "role": "user",
18 "content": [
19 {"type": "audio"},
20 #{"type": "text", "text": "请详细介绍一下强化学习中的GRPO。"},
21 ],
22 },
23]
24
25# Preparation for inference
26text = processor.apply_chat_template(
27 messages, tokenize=False, add_generation_prompt=True
28)
29
30import librosa
31audios = []
32audio_paths = [
33 "/mnt/diskhd/Backup/Dataset/WenetSpeech/audio/train/podcast/B00022/X0000005821_5113963_S01270.mp3",
34]
35
36for path in audio_paths:
37 audio, sr = librosa.load(path, sr=16000)
38 audios.append(audio)
39
40
41inputs = processor(
42 text=[text],
43 images=None,
44 videos=None,
45 #audios=None,
46 audios=audios,
47 padding=True,
48 return_tensors="pt",
49)
50inputs = inputs.to("cuda")
51
52generated_ids = model.generate(**inputs, max_new_tokens=512, do_sample=False)
53generated_ids_trimmed = [
54 out_ids[len(in_ids) :] for in_ids, out_ids in zip(inputs.input_ids, generated_ids)
55]
56output_text = processor.batch_decode(
57 generated_ids_trimmed, skip_special_tokens=True, clean_up_tokenization_spaces=False
58)
59print("output_text: ", output_text)