Views
No views yet
LLaMaCoder is based on LLaMa2 7B language model, finetuned using LoRA adaptors.1from transformers import AutoModelForCausalLM, BitsAndBytesConfig, AutoTokenizer
2import torch
3
4MODEL_NAME = "Sakuna/LLaMaCoderAll"
5device = "cuda:0"
6
7
8bnb_config = BitsAndBytesConfig(
9 load_in_4bit=True,
10 bnb_4bit_quant_type="nf4",
11 bnb_4bit_compute_dtype=torch.float16,
12)
13
14model = AutoModelForCausalLM.from_pretrained(
15 MODEL_NAME,
16 quantization_config=bnb_config,
17 trust_remote_code=True
18)
19
20tokenizer = AutoTokenizer.from_pretrained(MODEL_NAME, trust_remote_code=True)
21tokenizer.pad_token = tokenizer.eos_token
22
23model = model.to(device)
24model.eval()
25
26prompt = "Write a Java program to calculate the factorial of a given number k"
27input = f"{prompt}\n### Solution:\n"
28device = "cuda:0"
29
30inputs = tokenizer(input, return_tensors="pt").to(device)
31outputs = model.generate(**inputs, max_length=256, temperature=0.7)
32print(tokenizer.decode(outputs[0], skip_special_tokens=True))