Views
No views yet
1from vllm import LLM, SamplingParams
2from transformers import AutoTokenizer
3
4model_id = "RedHatAI/Llama-4-Maverick-17B-128E-Instruct-quantized.w4a16"
5number_gpus = 8
6
7sampling_params = SamplingParams(temperature=0.7, top_p=0.8, max_tokens=256)
8
9tokenizer = AutoTokenizer.from_pretrained(model_id)
10
11prompt = "Give me a short introduction to large language model."
12
13llm = LLM(model=model_id, tensor_parallel_size=number_gpus)
14
15outputs = llm.generate(prompt, sampling_params)
16
17generated_text = outputs[0].outputs[0].text
18print(generated_text)lm_eval \
--model vllm \
--model_args pretrained="RedHatAI/Llama-4-Scout-17B-16E-Instruct-FP8-dynamic",dtype=auto,add_bos_token=True,max_model_len=4096,tensor_parallel_size=8,gpu_memory_utilization=0.7,enable_chunked_prefill=True,trust_remote_code=True \
--tasks openllm \
--batch_size auto | Recovery (%) | meta-llama/Llama-4-Maverick-17B-128E-Instruct | RedHatAI/Llama-4-Maverick-17B-128E-Instruct-quantized.w4a16 (this model) | |
|---|---|---|---|
| ARC-Challenge 25-shot | 96.6 | 73.55 | 71.08 |
| GSM8k 5-shot | 99.7 | 93.18 | 92.87 |
| HellaSwag 10-shot | 99.6 | 87.27 | 86.95 |
| MMLU 5-shot | 99.8 | 85.98 | 85.78 |
| TruthfulQA 0-shot | 100.0 | 62.81 | 62.85 |
| WinoGrande 5-shot | 100.5 | 78.53 | 78.93 |
| OpenLLM v1 Average Score | 99.4 | 80.22 | 79.74 |