Training configurations for multiplex-thinking-countdown experiment. Two conditions: multiplex (w=3, soft thinking) vs baseline CoT (vanilla GRPO). Both train DeepSeek-R1-Distill-Qwen-7B on Countdown d4-d5.
Dataset Info
Rows: 2
Columns: 26
Columns
Column
Type
Description
condition
Value('string')
Experimental condition: multiplex or baseline_cot
experiment_name
Value('string')
WandB experiment name