Views
No views yet
filter-by-ppl-and-length (filtered for quality by perplexity and length)| Parameter | Value |
|---|---|
| Base Model | unsloth/Qwen3-4B-Base |
| Max Sequence Length | 4096 tokens |
| Training Epochs | 1 |
| Batch Size (per device) | 2 |
| Gradient Accumulation Steps | 8 |
| Effective Batch Size | 16 |
| Learning Rate | 2e-5 |
| Optimizer | AdamW (torch) |
| Weight Decay | 0.01 |
| LR Scheduler | Cosine |
| Warmup Steps | 10 |
| Warmup Ratio | 0.03 |
| Precision | BF16 (if supported) / FP16 |
| Seed | 3407 |
pip install transformers torch accelerate1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4model_name = "data-std/qwen3-4b-wiki-filter-28k"
5
6tokenizer = AutoTokenizer.from_pretrained(model_name)
7model = AutoModelForCausalLM.from_pretrained(
8 model_name,
9 device_map="auto",
10 torch_dtype=torch.bfloat16, # Use torch.float16 if BF16 not supported
11)
12
13# Generate text
14prompt = "Việt Nam là một quốc gia"
15inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
16
17outputs = model.generate(
18 **inputs,
19 max_new_tokens=256,
20 temperature=0.7,
21 top_p=0.9,
22 do_sample=True,
23 repetition_penalty=1.1,
24)
25
26generated_text = tokenizer.decode(outputs[0], skip_special_tokens=True)
27print(generated_text)1def format_instruction(instruction, context=""):
2 if context:
3 prompt = f"### Instruction:\n{instruction}\n\n### Context:\n{context}\n\n### Response:\n"
4 else:
5 prompt = f"### Instruction:\n{instruction}\n\n### Response:\n"
6 return prompt
7
8instruction = "Giải thích về lịch sử Việt Nam"
9prompt = format_instruction(instruction)
10
11inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
12outputs = model.generate(**inputs, max_new_tokens=512, temperature=0.7)
13print(tokenizer.decode(outputs[0], skip_special_tokens=True))1from unsloth import FastLanguageModel
2
3model, tokenizer = FastLanguageModel.from_pretrained(
4 model_name="data-std/qwen3-4b-wiki-filter-28k",
5 max_seq_length=4096,
6 dtype=None, # Auto-detect
7 load_in_4bit=True, # Use 4-bit quantization for memory efficiency
8)
9
10# Continue training or perform inference1from transformers import AutoTokenizer, AutoModelForCausalLM, BitsAndBytesConfig
2import torch
3
4# 4-bit quantization
5quantization_config = BitsAndBytesConfig(
6 load_in_4bit=True,
7 bnb_4bit_compute_dtype=torch.bfloat16,
8 bnb_4bit_use_double_quant=True,
9 bnb_4bit_quant_type="nf4"
10)
11
12model = AutoModelForCausalLM.from_pretrained(
13 "data-std/qwen3-4b-wiki-filter-28k",
14 quantization_config=quantization_config,
15 device_map="auto",
16)| Precision | VRAM Required | Inference Speed |
|---|---|---|
| FP32 | ~16 GB | Baseline |
| FP16/BF16 | ~8 GB | 2x faster |
| 4-bit | ~3-4 GB | Slightly slower, very memory efficient |