algo-sft-eval-baseline-Qwen2.5-1.5B-Instruct-v4
Baseline eval traces for Qwen2.5-1.5B-Instruct across all 4 domains × 3 splits
Rows: 8000
Columns: 10
Column
Type
Description
question_id
Value('string')
Unique question identifier from eval set
domain
Value('string')
Task domain
split
Value('string')
Evaluation split: test, harder, ood
prompt
Value('string')
Full prompt sent to the model