Views
No views yet
from_pretrained call.meta-llama/Llama-3.2-3B-Instructq_proj, v_projmeta-llama/Llama-3.2-3B-Instruct1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4model_id = "SardarTaimoor/llama3b-lora"
5
6tokenizer = AutoTokenizer.from_pretrained(model_id)
7
8model = AutoModelForCausalLM.from_pretrained(
9 model_id,
10 device_map="auto", # splits layers across GPU/CPU
11 torch_dtype=torch.float16, # half-precision on GPU
12 low_cpu_mem_usage=True # avoids fully materializing everything in host RAM
13)
14
15inputs = tokenizer("What's the Little Champs account?", return_tensors="pt").to(model.device)
16out = model.generate(**inputs, max_new_tokens=50, do_sample=False)
17print(tokenizer.decode(out[0], skip_special_tokens=True))
18print("-" * 60)
19