Views
No views yet
meta-llama/Llama-3.2-3B-Instructphase1_v3judge_llama3b_3epochglobal_step_1768ca31d# Run manifest — generated by run_phase1.sh
project_name : llmrnn_grpo
experiment_name : phase1_v3judge_llama3b_3epoch
launched_at : 2026-06-23T15:47:57Z
hostname : c310-002.ls6.tacc.utexas.edu
# Code identity
git_sha : 68ca31d
git_status : dirty
launcher_script : /var/spool/slurmd/job3251804/slurm_script
# Judge / reward
rubric_yaml : training/configs/rubric_v3_clinical_objectivity_llama.yaml
rubric_yaml_sha1 : ac6827fa2a7a3f542b9529abbce87ba01a09173d
judge_model : OpenRubrics/RubricARM-8B-Judge
judge_endpoint : http://localhost:8001
# Data
train_parquet : /scratch/11566/gabriel_xiong/data/llm_as_rnn/train.parquet
val_parquet : /scratch/11566/gabriel_xiong/data/llm_as_rnn/train.parquet
# Policy + GRPO
base_model : meta-llama/Llama-3.2-3B-Instruct
lora_rank : 16
lora_alpha : 32
lr : 3e-6
kl_coef : 0.001
kl_loss_type : low_var_kl
G_rollouts : 8
train_batch : 16
ppo_mini_batch : 16
total_epochs : 3