Views
No views yet
1graph TD
2 A[Dataset Gốc NVIDIA: 100,000 Bản Ghi] --> B[Giai Đoạn 1: Audit Chất Lượng & Dọn Dẹp Nhiễu]
3 B --> C[Giai Đoạn 2: Lọc & Giữ Lại 98,274 Bản Ghi Sạch]
4 C --> D[Giai Đoạn 3: Chuyển Đổi Sang Gemma 4 Chat Template]
5 D --> E[Giai Đoạn 4: Huấn Luyện LoRA Với Unsloth]
6 E --> F[Giai Đoạn 5: Lượng Tử Hóa GGUF Đa Dạng]<bos> để tránh trùng lặp token khi nạp vào Unsloth):google/gemma-4-E2B-it (Mô hình đa phương tiện thế hệ mới của Google).finetune_vision_layers = False) để bảo toàn nguyên vẹn năng lực xử lý đa phương tiện zero-shot gốc của Google.| File GGUF | Số bit | Kích thước | Khuyến nghị phần cứng & Thiết bị | Mức độ suy hao chất lượng |
|---|---|---|---|---|
gemma-4-e2b-it.Q2_K.gguf | 2-bit | ~0.85 GB | Máy có RAM cực kỳ hạn chế (điện thoại cũ, Raspberry Pi, thiết bị IoT). | Cao (Dùng khi cực kỳ thiếu bộ nhớ) |
gemma-4-e2b-it.Q3_K_M.gguf | 3-bit | ~1.10 GB | Thiết bị di động đời cũ, RAM ≤ 4GB. | Trung bình |
gemma-4-e2b-it.Q4_K_M.gguf | 4-bit | ~1.30 GB | [Khuyên dùng cho Edge] Điện thoại thông minh, máy tính bảng, máy tính cá nhân không có GPU rời. | Rất thấp (Độ cân bằng size/quality tốt nhất) |
gemma-4-e2b-it.Q5_K_M.gguf | 5-bit | ~1.55 GB | [Khuyên dùng cho PC] Card đồ họa VRAM 4–6GB hoặc CPU RAM ≥ 8GB. | Cực kỳ thấp (Sweet spot cho chất lượng cao) |
gemma-4-e2b-it.Q6_K.gguf | 6-bit | ~1.85 GB | Thiết bị có GPU rời VRAM ≥ 6GB hoặc CPU RAM ≥ 16GB. | Không đáng kể |
gemma-4-e2b-it.Q8_0.gguf | 8-bit | ~2.35 GB | Gần như lossless hoàn toàn so với mô hình gốc 16-bit. | Lossless |
gemma-4-e2b-it.F16-mmproj.gguf.gemma-4-e2b-it.Q4_K_M.gguf) và tệp projector đa phương tiện gemma-4-e2b-it.F16-mmproj.gguf về cùng một thư mục.Modelfile trong cùng thư mục đó với nội dung sau:1FROM ./gemma-4-e2b-it.Q4_K_M.gguf
2ADAPTER ./gemma-4-e2b-it.F16-mmproj.gguf
3
4# Thiết lập các tham số sinh văn bản
5PARAMETER temperature 0.7
6PARAMETER top_p 0.9
7PARAMETER stop "<|turn>"
8PARAMETER stop "<turn|>"
9
10# Định dạng Template hội thoại chuẩn của Gemma 4
11TEMPLATE """<|turn>user
12{{ .Prompt }}<turn|>
13<|turn>model
14"""
15
16# Cấu hình System Prompt mặc định
17SYSTEM """Bạn là một AI Agent chuyên nghiệp, đóng vai Persona người Việt để hỗ trợ người dùng."""1# Tạo mô hình trong hệ thống Ollama
2ollama create gemma4-personas -f Modelfile
3
4# Khởi chạy hội thoại trực tiếp
5ollama run gemma4-personas--mmproj):1./llama-cli -m gemma-4-e2b-it.Q4_K_M.gguf \
2 --mmproj gemma-4-e2b-it.F16-mmproj.gguf \
3 -p "<|turn>user\nHãy đóng vai một giáo viên 35 tuổi sống tại Hà Nội để tự giới thiệu về bản thân.<turn|>\n<|turn>model\n" \
4 -n 512 \
5 --temp 0.7llama-cpp-pythonllama-cpp-python:1from llama_cpp import Llama
2
3# Khởi tạo mô hình
4llm = Llama(
5 model_path="gemma-4-e2b-it.Q4_K_M.gguf",
6 n_ctx=2048,
7 n_threads=4 # Số luồng CPU sử dụng
8)
9
10# Tạo Prompt hội thoại chuẩn Gemma 4
11prompt = (
12 "<|turn>user\n"
13 "Hãy đóng vai một kỹ sư phần mềm 28 tuổi sống tại Thành phố Hồ Chí Minh để tự giới thiệu về bản thân.<turn|>\n"
14 "<|turn>model\n"
15)
16
17# Chạy mô hình
18response = llm(prompt, max_tokens=512, stop=["<|turn>", "<turn|>"])
19print(response["choices"][0]["text"])