Views
No views yet
daruokta/t5gemma2-indonesia-chat-formatted (chat_sft & indoqa_sft).1e-6 (LEARNING_RATE * 0.2) untuk menjaga representasi bahasa yang matang.2.5e-7 (LEARNING_RATE * 0.05) untuk jembatan pemetaan visual yang halus.0.0 (Frozen).max_grad_norm = 5.0 & WEIGHT_DECAY = 0.1):
| Kategori Tahap | Metrik Evaluasi | Eksperimen Lama (v4-vision) | Eksperimen Baru (v4-vision-enhanced) | Status Perbaikan |
|---|---|---|---|---|
| SFT Teks | Text-Only Validation Loss | 3.3538 🔴 (Exploded) | 2.4578 🟢 | ✅ Loss Teks Turun -26.7% |
| SFT Teks | Text-Only Perplexity | 28.61 🔴 (Membengkak) | 11.68 🟢 | ✅ Perplexity Membaik -59.2% |
| SFT Teks | Text-Only ROUGE-1 | 27.20% 🔴 (Drop) | 60.09% 🟢 | ✅ ROUGE-1 Naik +120.9% |
| SFT Teks | Text-Only Exact Match | 0.00% 🔴 (Lupa) | 🔥 33.33% 🟢 | 🎉 Forgetting 100% Teratasi |
| SFT Vision | Multimodal Loss (Gambar) | 2.9072 | 2.8800 🟢 | ✅ Loss Visual Terjaga & Menurun |
| SFT Vision | Multimodal ROUGE-1 | 37.65% | 42.83% 🟢 | ✅ Skor Visual Naik ke Puncak |
| ORPO Teks | Text-Only Validation Loss | - | 🔥 0.8591 🟢 | 🎉 Loss Teks Terendah Rekor Baru |
| ORPO Teks | Text-Only Perplexity | - | 🔥 2.36 🟢 | 🎉 PPL Terendah Rekor Baru |
| ORPO Teks | Text-Only ROUGE-1 | - | 🔥 61.65% 🟢 | 🎉 ROUGE-1 Puncak |
| ORPO Vision | Multimodal Loss (Gambar) | 1.5314 | 1.6151 🟢 | ✅ Preference Alignment Presisi |
daruokta/t5gemma2-indonesia-vision-formatteddaruokta/t5gemma2-indonesia-chat-formattedchat_sft (100 percakapan utuh multiturn) & indoqa_sft (100 sampel single-turn).1import torch
2from PIL import Image
3from transformers import AutoProcessor
4from unsloth import FastVisionModel
5
6model_id = "daruokta/t5gemma-2-4b-4b-instruct-chat-indo-v4-vision-enhanced"
7
8# Load model dan processor
9model, tokenizer = FastVisionModel.from_pretrained(
10 model_name=model_id,
11 load_in_4bit=True,
12 device_map="auto"
13)
14FastVisionModel.for_inference(model)
15
16processor = AutoProcessor.from_pretrained(model_id)
17
18# Buka gambar contoh
19image = Image.open("contoh_gambar.jpg").convert("RGB")
20
21messages = [
22 {
23 "role": "user",
24 "content": [
25 {"type": "image", "image": image},
26 {"type": "text", "text": "Jelaskan isi gambar ini secara rinci dalam Bahasa Indonesia."}
27 ]
28 }
29]
30
31prompt = processor.apply_chat_template(messages, add_generation_prompt=True)
32inputs = processor(text=prompt, images=image, return_tensors="pt").to("cuda")
33
34outputs = model.generate(
35 **inputs,
36 max_new_tokens=512,
37 use_cache=True,
38 temperature=0.7,
39 min_p=0.1
40)
41
42response = processor.batch_decode(outputs, skip_special_tokens=True)
43print(response[0])| Parameter | Nilai Fase Vision SFT | Nilai Fase Vision ORPO |
|---|---|---|
| Base Model | daruokta/t5gemma-2-4b-4b-instruct-chat-indo-v4-vision-cangkok | SFT Final Adapter Checkpoint |
| Vision Encoder | SigLIP 400M (Frozen) | SigLIP 400M (Frozen) |
| Multi-Modal Projector | Full Fine-Tuning (2.5e-7 LR) | Full Fine-Tuning (2.5e-7 LR) |
| Decoder LoRA Rank (r) | 256 | 256 |
| Decoder LoRA Alpha (α) | 512 | 512 |
| Decoder Learning Rate | 1e-6 | 1e-6 |
| Epochs | 2 | 1 |
| Weight Decay | 0.1 | 0.1 |
| Max Grad Norm | 5.0 | 5.0 |
| Effective Batch Size | 2 per device × 32 grad accumulation (64) | 2 per device × 32 grad accumulation (64) |
| Max Context Length | Source: 16384 / Target: 2048 | Source: 16384 / Target: 2048 |
