Views
No views yet
⚠️ This repository contains LoRA adapter weights only, not the full base model.
meta-llama/Meta-Llama-3-3B (or your exact base model name — update if needed)float16| Component | Value |
|---|---|
| Hidden Size | 3072 |
| Layers | 28 |
| Attention Heads | 24 |
| KV Heads | 8 |
| Intermediate Size | 8192 |
| Activation | SiLU |
| Max Context Length | 131072 |
| Vocabulary Size | 128256 |
float16pip install transformers peft bitsandbytes1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base_model_name = "meta-llama/Meta-Llama-3-3B"
5
6base_model = AutoModelForCausalLM.from_pretrained(
7 base_model_name,
8 load_in_4bit=True,
9 device_map="auto"
10)
11
12tokenizer = AutoTokenizer.from_pretrained(base_model_name)
13
14model = PeftModel.from_pretrained(base_model, "musheer/your-model-name")1input_text = "Solve: What is 2+2?"
2
3inputs = tokenizer(input_text, return_tensors="pt").to(model.device)
4
5outputs = model.generate(
6 **inputs,
7 max_new_tokens=200
8)
9
10print(tokenizer.decode(outputs[0]))1model = model.merge_and_unload()
2model.save_pretrained("merged_model")⚠️ This will increase size to ~7+ GB