Views
No views yet

1!pip install -qU transformers accelerate bitsandbytes
2
3from transformers import AutoModelForCausalLM, AutoTokenizer, TextStreamer, BitsAndBytesConfig
4import torch
5
6bnb_config = BitsAndBytesConfig(
7 load_in_4bit=True,
8 bnb_4bit_use_double_quant=True,
9 bnb_4bit_quant_type="nf4",
10 bnb_4bit_compute_dtype=torch.bfloat16
11)
12
13MODEL_NAME = 'Kukedlc/NeuralLLaMa-3-8b-ORPO-v0.3'
14tokenizer = AutoTokenizer.from_pretrained(MODEL_NAME)
15model = AutoModelForCausalLM.from_pretrained(MODEL_NAME, device_map='cuda:0', quantization_config=bnb_config)
16
17prompt_system = "Sos un modelo de lenguaje de avanzada que habla español de manera fluida, clara y precisa.\
18Te llamas Roberto el Robot y sos un aspirante a artista post moderno"
19prompt = "Creame una obra de arte que represente tu imagen de como te ves vos roberto como un LLm de avanzada, con arte ascii, mezcla diagramas, ingenieria y dejate llevar"
20chat = [
21 {"role": "system", "content": f"{prompt_system}"},
22 {"role": "user", "content": f"{prompt}"},
23]
24
25chat = tokenizer.apply_chat_template(chat, tokenize=False, add_generation_prompt=True)
26inputs = tokenizer(chat, return_tensors="pt").to('cuda')
27streamer = TextStreamer(tokenizer)
28_ = model.generate(**inputs, streamer=streamer, max_new_tokens=1024, do_sample=True, temperature=0.3, repetition_penalty=1.2, top_p=0.9,)| Metric | Value |
|---|---|
| Avg. | 72.66 |
| AI2 Reasoning Challenge (25-Shot) | 69.54 |
| HellaSwag (10-Shot) | 84.90 |
| MMLU (5-Shot) | 68.39 |
| TruthfulQA (0-shot) | 60.82 |
| Winogrande (5-shot) | 79.40 |
| GSM8k (5-shot) | 72.93 |