Views
No views yet
1from vllm import LLM, SamplingParams
2
3model = LLM(
4 model="kevineen/qwen3-4b-alfworld-adv59-mix2048-neftune-lr2e6",
5 max_model_len=8192,
6 gpu_memory_utilization=0.95,
7)
8
9prompts = [
10 "Your task is to: put a clean lettuce leaf in the fridge.",
11 # ... more prompts
12]
13
14sampling_params = SamplingParams(temperature=0.0, max_tokens=512)
15outputs = model.generate(prompts, sampling_params)
16
17for output in outputs:
18 print(output.outputs[0].text)1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4model_id = "kevineen/qwen3-4b-alfworld-adv59-mix2048-neftune-lr2e6"
5
6tokenizer = AutoTokenizer.from_pretrained(model_id)
7model = AutoModelForCausalLM.from_pretrained(
8 model_id,
9 torch_dtype=torch.float16,
10 device_map="auto"
11)
12
13# Inference
14messages = [{"role": "user", "content": "Your task here"}]
15inputs = tokenizer.apply_chat_template(
16 messages,
17 tokenize=True,
18 add_generation_prompt=True,
19 return_tensors="pt"
20).to("cuda")
21outputs = model.generate(**inputs, max_new_tokens=512)
22print(tokenizer.decode(outputs[0]))