Views
No views yet
ProjectScugnizz/scugnizz-llama-pcs.1# Train (HF Jobs)
2bash examples/train-hf-extractive-harden.sh
3
4# Train (RunPod PRO 6000)
5CLOUD_TYPE=COMMUNITY bash examples/train-runpod-extractive-harden.sh
6
7# Eval gate (HF Jobs)
8FLAVOR=t4-small bash examples/eval-hf-tool-context.sh
9
10# Eval gate (RunPod)
11CLOUD_TYPE=COMMUNITY bash examples/eval-runpod-tool-context.sh1export HF_TOKEN=hf_...
2export OUT_DIR=/mnt/rope-v2-training-results/runs/my-run
3export TARGET_TOKENS=1000000000
4export FLAVOR=a100x4
5export TOKENS_PER_STEP=262144
6export MODEL_SIZE=1.7b
7export HUB_REPO_ID=ProjectScugnizz/scugnizz-llama-pcs
8export HUB_PATH=training-runs/my-run
9export SCRIPT_SOURCE=hub:ProjectScugnizz/scugnizz-llama-training
10bash run-hf-job.shMODEL_SIZE | ~params |
|---|---|
1b | 1.0B |
1.7b | 1.7B |
3b | 3.0B |
OUT_DIR/checkpoint_resume.pt or checkpoint_last.pt — full resume with optimizerINIT_FROM — bucket/local path to model_final.pt or full checkpointINIT_HUB_REPO + INIT_HUB_FILE — download from HubOUT_DIR/model_final.pt — weights-only fallback1# Continue an existing bucket run (automatic if checkpoints exist)
2export OUT_DIR=/mnt/rope-v2-training-results/runs/pretrain-fineweb-llama-pcs-1.7b
3
4# Start from Hub weights
5export INIT_HUB_REPO=ProjectScugnizz/scugnizz-llama-pcs
6export INIT_HUB_FILE=training-runs/pretrain-fineweb-llama-pcs-550m/model_final.pt
7export INIT_STEP=2100
8
9# Start from bucket file
10export INIT_FROM=/mnt/rope-v2-training-results/runs/pretrain-fineweb-llama-pcs-1.7b/model_final.pt
11export INIT_STEP=0
12export NO_RESUME=1torchrun automatically when the job has >1 GPU. Set global throughput with:1export TOKENS_PER_STEP=262144 # auto-computes GRAD_ACCUM per GPU count
2# or set GRAD_ACCUM manually per GPUhf jobs stats ProjectScugnizz/<job_id>checkpoint_resume.pt, checkpoint_last.ptcheckpoint_weights_last.pt/tmp/scugnizz-ckpts first; only resume/last copied to bucket. Defaults: WEIGHTS_SAVE_INTERVAL=0, SAVE_INTERVAL=100. Logs show (N inst) instantaneous tok/s.1export CKPT_LOCAL_DIR=/tmp/scugnizz-ckpts
2export WEIGHTS_SAVE_INTERVAL=0
3export SAVE_INTERVAL=100
4bash cleanup-checkpoints.sh hf://buckets/ProjectScugnizz/rope-v2-training-results/runs/my-run| File | Purpose |
|---|---|
scugnizz-llama.py | Model + training loop (DDP) |
job.sh | In-job entrypoint (pip install + torchrun) |
run-hf-job.sh | Parametrized HF Jobs submitter |
examples/ | Example launch configs |