Views
No views yet
| Parameter | Value |
|---|---|
| Framework | transformers 4.51+ + accelerate |
| Base model | Qwen/Qwen3.5-0.8B-Base |
| Precision | bf16 |
| Epochs | 1 |
| Effective batch size | 32 sequences (per_device=2 × grad_accum=16) |
| Max sequence length | 1 024 tokens |
| Learning rate | 1e-4 (cosine scheduler) |
| Warmup steps | 30 |
| Weight decay | 0.01 |
| Gradient checkpointing | yes |
| Tokens seen | ~7.2M (7 016 docs × ~1 024 tokens) |
| Compute | OVH AI Training — A100 32 GB |
| Training time | ~2h30 (220 optimizer steps) |
| Seed | 42 |
Qwen/Qwen3.5-0.8B-Base on held-out sets:| Metric | Base Qwen3.5-0.8B | This model | Delta |
|---|---|---|---|
| Perplexity held-out (200 docs) | 16.083 | 14.115 | -1.97 (-12.2%) |
| Domain QA accuracy (50 q, MMLU-style) | 64.0% | 60.0% | -4.0% |
| Hellaswag-200 accuracy | 44.5% | 42.0% | -2.5% |
1git clone https://github.com/Nyries/racine-ai-middle-east-cpt
2cd cpt
3python eval_perplexity.py --finetuned ./checkpoints/checkpoint-220
4python eval_qa.py --finetuned ./checkpoints/checkpoint-220
5python eval_hellaswag.py --finetuned ./checkpoints/checkpoint-2201@misc{nyries2025qwen3middleeast,
2 title={Qwen3.5-0.8B continuous pre-training on Middle East geopolitics},
3 author={Nyries},
4 year={2025},
5 url={https://huggingface.co/Nyries/qwen3-0.8b-middle-east-cpt}
6}