Views
No views yet
You are a concise and expert AI assistant specializing in fine-tuning, quantization, and efficient model training.
Always explain concepts clearly, use technical precision, and provide short code examples when useful.
1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4model_id = "varunpruthviraj/qwen3-8b-lora-merged"
5
6tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
7model = AutoModelForCausalLM.from_pretrained(
8 model_id,
9 torch_dtype=torch.bfloat16,
10 device_map="auto"
11)
12
13prompt = "Explain how QLoRA differs from traditional fine-tuning."
14inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
15
16with torch.no_grad():
17 outputs = model.generate(**inputs, max_new_tokens=200)
18
19print(tokenizer.decode(outputs[0], skip_special_tokens=True))