Views
No views yet
1from vllm import LLM, SamplingParams
2from transformers import AutoTokenizer
3
4model_id = "duydq12/Qwen2.5-Coder-3B-Instruct-FP8-dynamic"
5number_gpus = 1
6sampling_params = SamplingParams(temperature=0.6, top_p=0.95, top_k=20, min_p=0, max_tokens=256)
7
8messages = [
9 {"role": "user", "content": prompt}
10]
11
12tokenizer = AutoTokenizer.from_pretrained(model_id)
13
14messages = [{"role": "user", "content": "Give me a short introduction to large language model."}]
15
16prompts = tokenizer.apply_chat_template(messages, add_generation_prompt=True, tokenize=False)
17
18llm = LLM(model=model_id, tensor_parallel_size=number_gpus)
19
20outputs = llm.generate(prompts, sampling_params)
21
22generated_text = outputs[0].outputs[0].text
23print(generated_text)1from llmcompressor.modifiers.quantization import QuantizationModifier
2from llmcompressor.transformers import oneshot
3from transformers import AutoModelForCausalLM, AutoTokenizer
4
5# Load model
6model_stub = "Qwen/Qwen2.5-Coder-3B-Instruct"
7model_name = model_stub.split("/")[-1]
8
9model = AutoModelForCausalLM.from_pretrained(model_stub, torch_dtype="auto", device_map="auto")
10tokenizer = AutoTokenizer.from_pretrained(model_stub, torch_dtype="auto", device_map="auto")
11
12# Configure the quantization algorithm and scheme
13recipe = QuantizationModifier(
14 ignore=["lm_head"],
15 targets="Linear",
16 scheme="FP8_dynamic",
17)
18
19# Apply quantization
20oneshot(
21 model=model,
22 recipe=recipe,
23)
24
25# Save to disk in compressed-tensors format
26save_path = model_name + "-FP8-dynamic"
27model.save_pretrained(save_path)
28tokenizer.save_pretrained(save_path)
29print(f"Model and tokenizer saved to: {save_path}")