Views
No views yet
unsloth/Llama-3.2-3B-bnb-4bit1pip install unsloth
2pip install torch transformers peft accelerate bitsandbytes1from unsloth import FastLanguageModel
2
3model, tokenizer = FastLanguageModel.from_pretrained(
4 model_name = "Sachin016/llama-Nemotron-Personas-India-finetuned",
5 max_seq_length = 2048,
6 dtype = None,
7 load_in_4bit = True,
8)
9
10FastLanguageModel.for_inference(model)1alpaca_prompt = """### Instruction:
2{}
3
4### Input:
5{}
6
7### Response:
8{}"""
9
10question = "Explain AI in simple words"
11
12inputs = tokenizer(
13 [alpaca_prompt.format(question, "", "")],
14 return_tensors = "pt"
15).to("cuda")
16
17outputs = model.generate(
18 **inputs,
19 max_new_tokens = 128,
20 use_cache = True
21)
22
23response = tokenizer.batch_decode(outputs)[0].split("### Response:")[1].strip()
24
25print(response)| Property | Value |
|---|---|
| Base Model | unsloth/Llama-3.2-3B-bnb-4bit |
| Fine-tuning Method | LoRA |
| Quantization | 4-bit |
| Framework | Unsloth + HuggingFace PEFT |
| Max Sequence Length | 2048 |
| Language | English |
| Training Type | Instruction Fine-tuning |
| Domain | Conversational AI |
| Specialization | Persona-based responses |
1TrainingArguments(
2 per_device_train_batch_size = 2,
3 gradient_accumulation_steps = 4,
4 warmup_steps = 5,
5 num_train_epochs = 3,
6 learning_rate = 2e-4,
7 optim = "adamw_8bit",
8)1### Instruction:
2<your instruction>
3
4### Input:
5<optional context>
6
7### Response:
8<model output>1from huggingface_hub import login
2
3login(token="YOUR_HUGGINGFACE_TOKEN")
4
5from unsloth import FastLanguageModel
6
7model, tokenizer = FastLanguageModel.from_pretrained(
8 model_name = "/content/drive/MyDrive/llama_project/finetuned_model",
9 max_seq_length = 2048,
10 dtype = None,
11 load_in_4bit = True,
12)
13
14model.push_to_hub(
15 "Sachin016/llama-Nemotron-Personas-India-finetuned",
16 token="YOUR_HUGGINGFACE_TOKEN"
17)
18
19tokenizer.push_to_hub(
20 "Sachin016/llama-Nemotron-Personas-India-finetuned",
21 token="YOUR_HUGGINGFACE_TOKEN"
22)