Views
No views yet
4-bit NF4 quantized version of Llama 3.2 1B for convenient QLoRA training and efficient inference.
meta-llama/Llama-3.2-1Btorch.bfloat16 compute with 4-bit weights1from transformers import AutoTokenizer, AutoModelForCausalLM, BitsAndBytesConfig
2import torch
3
4model_id = "rapidfire-ai-inc/Llama-3.2-1B-bnb-4bit"
5
6bnb_config = BitsAndBytesConfig(
7 load_in_4bit=True,
8 bnb_4bit_compute_dtype=torch.bfloat16,
9 bnb_4bit_use_double_quant=True,
10 bnb_4bit_quant_type="nf4",
11)
12
13tok = AutoTokenizer.from_pretrained(model_id, use_fast=True)
14model = AutoModelForCausalLM.from_pretrained(
15 model_id,
16 device_map="auto",
17 quantization_config=bnb_config,
18 torch_dtype=torch.bfloat16,
19)
20
21messages = [
22 {"role": "system", "content": "You are a helpful assistant."},
23 {"role": "user", "content": "Write a haiku about GPUs."}
24]
25prompt = tok.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
26
27inputs = tok(prompt, return_tensors="pt").to(model.device)
28out = model.generate(
29 **inputs,
30 max_new_tokens=128,
31 temperature=0.7,
32 top_p=0.9,
33)
34print(tok.decode(out[0], skip_special_tokens=True))1from transformers import BitsAndBytesConfig
2import torch
3
4bnb_config = BitsAndBytesConfig(
5 load_in_4bit=True,
6 bnb_4bit_compute_dtype=torch.bfloat16,
7 bnb_4bit_use_double_quant=True,
8 bnb_4bit_quant_type="nf4",
9)meta-llama/Llama-3.2-1B. May produce inaccurate or biased content. Do not deploy in high‑risk settings without safeguards.apply_chat_template if the upstream tokenizer provides a chat template.torch_dtype=torch.bfloat16 and load_in_4bit=True.1@misc{rapidfireai_Llama_3.2_1B_bnb_4bit_bnb4bit_2025,
2 title = {Llama-3.2-1B-bnb-4bit (RapidFire AI)},
3 author = {RapidFire AI, Inc.},
4 year = {2025},
5 howpublished = {\url{https://huggingface.co/rapidfire-ai-inc/Llama-3.2-1B-bnb-4bit}}
6}