Views
No views yet
!pip -q install transformers accelerate safetensors bitsAndBytes1from transformers import AutoTokenizer, AutoModelForCausalLM, BitsAndBytesConfig
2import torch
3
4repo = "Luke-griggs/small-talk-1.3"
5
6bnb_config = BitsAndBytesConfig(
7 load_in_4bit=True,
8 bnb_4bit_use_double_quant=True,
9 bnb_4bit_quant_type="nf4",
10 bnb_4bit_compute_dtype=torch.bfloat16, # or float16 if needed
11)
12
13tokenizer = AutoTokenizer.from_pretrained(repo)
14model = AutoModelForCausalLM.from_pretrained(
15 repo,
16 torch_dtype=torch.float16,
17 device_map="auto"
18 )
19model.eval()1chat = [
2 {"role": "system",
3 "content": """
4You are a helpful, polite, and friendly assistant. Answer questions to the best of your ability.
5If you don't know something, be honest and say so. Keep responses clear and concise."},
6
7"""},
8 {"role": "user", "content": "What's your favorite thing to do?"}
9]
10
11prompt = tokenizer.apply_chat_template(chat, tokenize=False, add_generation_prompt=True)
12
13inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
14
15with torch.no_grad():
16 output = model.generate(
17 **inputs,
18 max_new_tokens=128,
19 do_sample=True,
20 temperature=0.7,
21 top_p=0.9
22 )
23
24
25full_text = tokenizer.decode(output[0], skip_special_tokens=True)
26prompt_text = tokenizer.decode(inputs['input_ids'][0], skip_special_tokens=True)
27
28print(full_text[len(prompt_text):])