Views
No views yet
Qwen/Qwen2.5-7B and is intended as the CPT
checkpoint before later SFT, DPO, and GRPO stages.Qwen/Qwen2.5-7Badapter/: PEFT LoRA adapter weights and configtokenizer/: tokenizer saved with the CPT runtraining_config.json: Modal CPT training configurationmetrics.json: training and evaluation metricsevaluation_report.json: CPT adapter evaluation report, if availablebase_evaluation_report.json: base model evaluation report, if availablesamples.txt: qualitative generation samples/data/processed/kalenjin_cpt_eval.jsonl| Model | Eval loss | Perplexity | Metric |
|---|---|---|---|
| Base | 5.4601 | 235.1302 | batch mean |
| CPT adapter | 2.7906 | 16.2915 | batch mean |
1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4base_model = "Qwen/Qwen2.5-7B"
5adapter_repo = "Sugutt/Kalenjin-qwen2.5-7B"
6
7tokenizer = AutoTokenizer.from_pretrained(adapter_repo)
8model = AutoModelForCausalLM.from_pretrained(base_model, device_map="auto")
9model = PeftModel.from_pretrained(model, adapter_repo)1{
2 "model_name": "Qwen/Qwen2.5-7B",
3 "train_file": "/data/processed/kalenjin_cpt_train.jsonl",
4 "eval_file": "/data/processed/kalenjin_cpt_eval.jsonl",
5 "output_dir": "/outputs/kalenjin-cpt",
6 "max_seq_length": 2048,
7 "epochs": 2.0,
8 "learning_rate": 2e-05,
9 "batch_size": 2,
10 "grad_accum": 8,
11 "lora_r": 32,
12 "lora_alpha": 32,
13 "lora_dropout": 0.05,
14 "save_steps": 100,
15 "logging_steps": 10,
16 "max_steps": -1,
17 "warmup_ratio": 0.03,
18 "weight_decay": 0.01,
19 "lr_scheduler_type": "cosine",
20 "optimizer": "paged_adamw_8bit",
21 "run_name": "kalenjin-cpt",
22 "wandb_enabled": true,
23 "wandb_project": "kalenjin-llm",
24 "wandb_entity": "",
25 "wandb_tags": "cpt,kalenjin,modal",
26 "wandb_mode": "online"
27}