Views
No views yet
Multiple LLM CoTs per question → Aggregation → Structured format (Task 1/2/3/Summary)
↓
SFT training data
↓
GRPO (raw questions → model generates → reward)| Aspect | Choice | Rationale |
|---|---|---|
| Base model | Qwen3-1.7B | Newest Qwen family, native thinking mode, fits T4 with QLoRA |
| Quantization | QLoRA (4-bit NF4) | Required for T4 16GB — full model is ~4GB in 4-bit + LoRA adapters |
| LoRA rank | r=32, alpha=64 | Higher rank for complex domain (5G telecom) |
| SFT data | truemoham/aggregated_tele_logs | Aggregated CoT (~500 tokens per answer vs ~2200 for raw) |
| GRPO data | tecnicolaude/Telelogs-CoT | Questions + ground truth labels for reward computation |
| Reward functions | Accuracy (binary) + Format (continuous) | Paper uses classification accuracy; format reward encourages structured CoT |
truemoham/aggregated_tele_logs):\boxed{Cx} formatted answertecnicolaude/Telelogs-CoT):netop/TeleLogs troubleshooting/test):1pip install -r requirements.txt
2# Or manually:
3pip install trl==1.4.0 transformers==5.7.0 peft==0.19.1 datasets==4.8.5 \
4 accelerate==1.13.0 bitsandbytes==0.49.2 trackio==0.25.11from huggingface_hub import login
2login()1git clone https://huggingface.co/truemoham/5g-rca-reasoning-pipeline
2cd 5g-rca-reasoning-pipeline1import os
2os.environ["HUB_MODEL_ID"] = "YOUR_USERNAME/sft-5g-rca-qwen3-1.7b"
3os.environ["TRACKIO_PROJECT"] = "5g-rca-reasoning"!python sft_5g_rca.py1import os
2os.environ["SFT_MODEL_ID"] = "YOUR_USERNAME/sft-5g-rca-qwen3-1.7b"
3os.environ["HUB_MODEL_ID"] = "YOUR_USERNAME/grpo-5g-rca-qwen3-1.7b"!python grpo_5g_rca.py1import os
2os.environ["EVAL_MODEL_ID"] = "YOUR_USERNAME/grpo-5g-rca-qwen3-1.7b"!python eval_5g_rca.py| File | Description |
|---|---|
sft_5g_rca.py | Stage 1: SFT on aggregated CoT data |
grpo_5g_rca.py | Stage 2: GRPO with accuracy + format rewards |
eval_5g_rca.py | Evaluation on TeleLogs test set (864 examples) |
requirements.txt | Pinned library versions (verified conflict-free) |
notebook_guide.py | Quick reference for Colab cells |
trl==1.4.0
transformers==5.7.0
peft==0.19.1
accelerate==1.13.0
datasets==4.8.5
bitsandbytes==0.49.2
trackio==0.25.1
torch>=2.3.0trackio package requires huggingface-hub>=1.10.0, but transformers 4.x caps huggingface-hub<1.0. Only transformers 5.x (which uses huggingface-hub>=1.5.0) resolves this conflict. Additionally, trl==1.4.0 requires transformers>=4.56.2 and datasets>=4.7.0.1@article{reasoning5grca2025,
2 title={Reasoning Language Models for Root Cause Analysis in 5G Wireless Networks},
3 journal={arXiv preprint arXiv:2507.21974},
4 year={2025}
5}