Llama 3.2 3B Instruct をベースに、Alpaca データセットを使って指示応答タスクに特化させた LoRA アダプターです。4-bit 量子化により、限られた VRAM でも効率的に動作します。
1from unsloth import FastLanguageModel
2
3# モデルとトークナイザーのロード
4model, tokenizer = FastLanguageModel.from_pretrained(
5 model_name="MakiAi/llama-3.2-3b-alpaca-lora",
6 max_seq_length=2048,
7 load_in_4bit=True,
8)
9
10# 推論用に最適化
11FastLanguageModel.for_inference(model)
12
13# プロンプトテンプレート
14alpaca_prompt = """Below is an instruction that describes a task, paired with an input that provides further context. Write a response that appropriately completes the request.
15
16### Instruction:
17{}
18
19### Input:
20{}
21
22### Response:
23{}"""
24
25# テキスト生成
26inputs = tokenizer(
27 [alpaca_prompt.format(
28 "日本の首都について教えてください。", # instruction
29 "", # input
30 "", # output (空欄で生成)
31 )],
32 return_tensors="pt"
33).to("cuda")
34
35outputs = model.generate(
36 **inputs,
37 max_new_tokens=256,
38 use_cache=True
39)
40
41print(tokenizer.batch_decode(outputs))
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3import torch
4
5# ベースモデルのロード
6base_model = AutoModelForCausalLM.from_pretrained(
7 "unsloth/Llama-3.2-3B-Instruct-bnb-4bit",
8 device_map="auto",
9 load_in_4bit=True,
10)
11
12tokenizer = AutoTokenizer.from_pretrained("unsloth/Llama-3.2-3B-Instruct-bnb-4bit")
13
14# LoRA アダプターの適用
15model = PeftModel.from_pretrained(base_model, "MakiAi/llama-3.2-3b-alpaca-lora")
16
17# 推論
18inputs = tokenizer("Tell me about artificial intelligence.", return_tensors="pt").to("cuda")
19outputs = model.generate(**inputs, max_new_tokens=200)
20print(tokenizer.decode(outputs[0], skip_special_tokens=True))
1@misc{llama32alpaca2026,
2 title={Llama 3.2 3B Alpaca LoRA},
3 author={MakiAi},
4 year={2026},
5 publisher={Hugging Face},
6 howpublished={\url{https://huggingface.co/MakiAi/llama-3.2-3b-alpaca-lora}}
7}