Views
No views yet
1from vllm import LLM, SamplingParams
2from transformers import AutoTokenizer
3
4model_id = "neuralmagic/Qwen2.5-72B-quantized.w8a16"
5number_gpus = 2
6max_model_len = 8192
7
8sampling_params = SamplingParams(temperature=0.7, top_p=0.8, max_tokens=256)
9
10tokenizer = AutoTokenizer.from_pretrained(model_id)
11
12prompt = "Give me a short introduction to large language model."
13
14llm = LLM(model=model_id, tensor_parallel_size=number_gpus, max_model_len=max_model_len)
15
16outputs = llm.generate(prompt, sampling_params)
17
18generated_text = outputs[0].outputs[0].text
19print(generated_text)| Category | Benchmark | Qwen2.5-72B | Qwen2.5-72B-quantized.w8a16 (this model) | Recovery |
| OpenLLM v1 | ||||
| MMLU (5-shot) | 86.05 | 85.98 | 99.9% | |
| ARC Challenge (25-shot) | 68.26 | 68.17 | 99.9% | |
| GSM-8k (5-shot, strict-match) | 88.63 | 89.16 | 100.6% | |
| Hellaswag (10-shot) | 87.53 | 87.49 | 100.0% | |
| Winogrande (5-shot) | 82.56 | 82.56 | 100.0% | |
| TruthfulQA (0-shot, mc2) | 60.44 | 60.30 | 99.8% | |
| Average | 78.91 | 78.94 | 100.0% |
lm_eval \
--model vllm \
--model_args pretrained="neuralmagic/Qwen2.5-72B-quantized.w8a16",dtype=auto,max_model_len=4096,add_bos_token=True,tensor_parallel_size=2 \
--tasks openllm \
--batch_size auto