Views
No views yet
meta-llama/Llama-3.2-3B-Instruct model.bitsandbytes.
nf4bfloat16r): 256alpha): 128transformers, peft, trlFP16/BF16 (based on hardware support)fused adamwpeft library.pip install transformers torch bitsandbytes peft1from transformers import AutoTokenizer, AutoModelForCausalLM, BitsAndBytesConfig
2from peft import PeftModel, PeftConfig
3import torch
4
5# Configure 4-bit quantization
6bnb_config = BitsAndBytesConfig(
7 load_in_4bit=True,
8 bnb_4bit_use_double_quant=True,
9 bnb_4bit_quant_type="nf4",
10 bnb_4bit_compute_dtype=torch.bfloat16
11)
12
13# Load the base model
14base_model_name = "meta-llama/Llama-3.2-3B-Instruct"
15model = AutoModelForCausalLM.from_pretrained(
16 base_model_name,
17 quantization_config=bnb_config,
18 torch_dtype="auto",
19 device_map="auto"
20)
21
22# Load the QLoRA adapters
23adapter_model_name = "Geraldine/FineLlama-3.2-3B-Instruct-ead-Adapters"
24model = PeftModel.from_pretrained(model, adapter_model_name)
25
26# Load the tokenizer
27tokenizer = AutoTokenizer.from_pretrained(base_model_name)1messages = [
2 {"role": "system", "content": "You are an expert in EAD/XML generation for archival records metadata."},
3 {"role": "user", "content": "Generate a minimal and compliant <eadheader> template with all required EAD/XML tags"},
4]
5
6inputs = tokenizer.apply_chat_template(
7 messages,
8 return_tensors="pt",
9 add_generation_prompt=True
10).to(model.device)
11
12outputs = model.generate(inputs, max_new_tokens=4096, use_cache=True)
13print(tokenizer.decode(outputs[0], skip_special_tokens=True))1@misc{ead-llama-adapters,
2 author = {Géraldine Geoffroy},
3 title = {FineLlama-3.2-3B-Instruct-ead QLoRA Adapters},
4 year = {2024},
5 publisher = {HuggingFace},
6 journal = {HuggingFace Repository},
7 howpublished = {\url{https://huggingface.co/Geraldine/qlora-FineLlama-3.2-3B-Instruct-ead}}
8}