Views
No views yet
transformers (Unsloth FastLanguageModel when available, else transformers + bitsandbytes 4-bit + peft)trl.SFTTrainerGRPOTrainer OOMs on T4 because it holds all K trajectories' computation graphs simultaneously; ours is two-phase: no-grad rollout collection then per-step backward)huggingface_hub.push_to_hub + upload_file| field | value |
|---|---|
| base model | Qwen/Qwen2.5-0.5B-Instruct |
| engine | transformers |
| SFT trainer | trl.SFTTrainer |
| RL algo | grpo (auto: trl present -> using episode-level GRPO) |
| trainable params | 540,672 / 11.973056694274142 (4515739.08%) |
| SFT episodes | 16 |
| RL episodes | 24 |
| eval episodes | 8 |
| eval mean reward | 10.46 |
| frozen base | True |
| lora only | True |
| quick mode | True |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base = "Qwen/Qwen2.5-0.5B-Instruct"
5adapter = "Kabs-123/clustermind-lora"
6
7tok = AutoTokenizer.from_pretrained(base)
8model = AutoModelForCausalLM.from_pretrained(base, device_map="auto")
9model = PeftModel.from_pretrained(model, adapter)adapter_model.safetensors — LoRA weightsadapter_config.json — LoRA config (r, alpha, target modules)tokenizer.json etc. — tokenizer of the base modeltraining_logs.jsonl — per-step reward + loss + metricstrained_results.json — full training summarytrained_results.json
for the full eval breakdown.