Views
No views yet
1from vllm import LLM, SamplingParams
2from transformers import AutoTokenizer
3
4model_id = "neuralmagic/Qwen2.5-0.5B-Instruct-quantized.w8a8"
5number_gpus = 1
6max_model_len = 8192
7
8sampling_params = SamplingParams(temperature=0.7, top_p=0.8, max_tokens=256)
9
10tokenizer = AutoTokenizer.from_pretrained(model_id)
11
12prompt = "Give me a short introduction to large language model."
13
14llm = LLM(model=model_id, tensor_parallel_size=number_gpus, max_model_len=max_model_len)
15
16outputs = llm.generate(prompt, sampling_params)
17
18generated_text = outputs[0].outputs[0].text
19print(generated_text)lm_eval \
--model vllm \
--model_args pretrained="neuralmagic/Qwen2.5-0.5B-Instruct-quantized.w8a8",dtype=auto,gpu_memory_utilization=0.9,add_bos_token=True,max_model_len=4096,enable_chunk_prefill=True,tensor_parallel_size=1 \
--tasks openllm \
--batch_size auto| Benchmark | Qwen2.5-0.5B-Instruct | Qwen2.5-0.5B-Instruct-quantized.w8a8 (this model) | Recovery | |
| OpenLLM v1 | MMLU (5-shot) | 46.83 | 46.29 | 98.9% |
| ARC Challenge (25-shot) | 33.62 | 33.36 | 99.2% | |
| GSM-8K (5-shot, strict-match) | 33.21 | 33.21 | 100.0% | |
| Hellaswag (10-shot) | 51.31 | 50.97 | 99.3% | |
| Winogrande (5-shot) | 55.01 | 55.01 | 100.0% | |
| TruthfulQA (0-shot, mc2) | 41.85 | 41.47 | 99.1% | |
| Average | 43.64 | 43.38 | 99.4% | |
| OpenLLM v2 | MMLU-Pro (5-shot) | 17.49 | 16.95 | 96.9% |
| IFEval (0-shot) | 31.17 | 32.04 | 102.8% | |
| BBH (3-shot) | 32.79 | 32.51 | 99.2% | |
| Math-lvl-5 (4-shot) | 0.21 | 0.17 | *** | |
| GPQA (0-shot) | 25.67 | 26.12 | 101.8% | |
| MuSR (0-shot) | 33.02 | 32.75 | 99.2% | |
| Average | 23.39 | 23.42 | 100.1% |