Views
No views yet

| Property | Value |
|---|---|
| Base model | Qwen/Qwen2.5-0.5B |
| Training type | Full-parameter Continued Pre-Training (CPT) |
| Dataset | VietAI/vi_pubmed (92k English abstracts) |
| Tokens trained on | ~23.6 million |
| Block size | 256 tokens |
| Training objective | Causal Language Modeling (CLM) |
| Optimizer | AdamW 8-bit (bitsandbytes) |
| Learning rate | 2e-5 (cosine schedule) |
| Hardware | Kaggle Tesla T4 (15.6GB VRAM) |
| Training time | ~3h 45m |
| Starting loss | 2.581 |
| Final loss | ~2.48 |
| Precision | fp32 master weights + AMP fp16 |