TrajBias: Structural Biases in LLM-as-Judge Evaluation of Agent Trajectories
Dataset Description
TrajBias is a diagnostic benchmark for auditing biases in LLM-as-Judge evaluation of agent trajectories. It contains:
2,400 probe pairs: Controlled perturbation experiments testing 5 bias types
20,000+ evaluations: Scores from 7 judge models across 7 model families
Statistical results: Complete analysis with Cliff's delta, Wilcoxon tests, and BH FDR correction… See the full description on the dataset page: https://huggingface.co/datasets/yufenghe/trajbias-benchmark.