Views
No views yet
1from vllm import LLM, SamplingParams
2from transformers import AutoTokenizer
3
4model_id = "selimaktas/Qwen3-14B-FP8-MinMax"
5tokenizer = AutoTokenizer.from_pretrained(model_id)
6
7# Initialize vLLM
8llm = LLM(model=model_id, tensor_parallel_size=1)
9
10# Generate
11messages = [{"role": "user", "content": "Explain quantum computing"}]
12prompts = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
13sampling_params = SamplingParams(temperature=0.6, top_p=0.95, max_tokens=256)
14
15outputs = llm.generate(prompts, sampling_params)
16print(outputs[0].outputs[0].text)1lm_eval --model vllm \
2 --model_args pretrained=selimaktas/Qwen3-14B-FP8-MinMax,dtype=auto,add_bos_token=True \
3 --tasks gsm8k --num_fewshot 5 --batch_size auto