Views
No views yet
| Configuration | Value |
|---|---|
| Hardware | 2x NVIDIA T4 (16GB each) |
| Platform | Kaggle |
| Framework | Unsloth + PEFT |
| LoRA Rank (r) | 16 |
| LoRA Alpha | 16 |
| LoRA Dropout | 0.0 |
| Target Modules | Attention, MLP |
| Vision Layers | Frozen |
| Language Layers | Trainable |
| Effective Batch Size | 16 |
| Learning Rate | 2e-4 |
| Optimizer | AdamW 8-bit |
| Warmup Steps | 10 |
| Weight Decay | 0.01 |
| Max Sequence Length | 2048 |
| Quantization | 4-bit (for loading) |
| Adapter Size | 0.66 GB |
pip install transformers accelerate peft torch bitsandbytes1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3from peft import PeftModel
4
5# Load base model with 4-bit quantization
6base_model = AutoModelForCausalLM.from_pretrained(
7 "unsloth/Muse-Glimmer-30B",
8 torch_dtype=torch.float16,
9 load_in_4bit=True,
10 device_map="auto"
11)
12
13# Load LoRA adapter
14model = PeftModel.from_pretrained(
15 base_model,
16 "aliRafik/Muse-Glimmer-30B-finetuned-mlabonne"
17)
18
19# Load tokenizer
20tokenizer = AutoTokenizer.from_pretrained(
21 "aliRafik/Muse-Glimmer-30B-finetuned-mlabonne"
22)1def generate_response(prompt, max_length=256):
2 inputs = tokenizer(prompt, return_tensors="pt")
3
4 with torch.no_grad():
5 outputs = model.generate(
6 **inputs,
7 max_new_tokens=max_length,
8 temperature=0.7,
9 do_sample=True,
10 top_p=0.9,
11 repetition_penalty=1.1,
12 pad_token_id=tokenizer.eos_token_id
13 )
14
15 return tokenizer.decode(
16 outputs[0],
17 skip_special_tokens=True
18 )
19
20
21# Example
22response = generate_response("Your prompt here")
23print(response)| Precision | GPU Memory Required |
|---|---|
| 4-bit (Recommended) | ~12 GB |
| 8-bit | ~18 GB |
| 16-bit (FP16) | ~35 GB |
1@misc{muse-glimmer-30b-lora-2024,
2 author = {Ali Rafik},
3 title = {Muse Glimmer 30B - LoRA Fine-tuned Adapter},
4 year = {2024},
5 publisher = {Hugging Face},
6 howpublished = {\url{https://huggingface.co/aliRafik/Muse-Glimmer-30B-finetuned-mlabonne}}
7}