Dataset from Causal Judge Evaluation experiments on Chatbot Arena data.
cje_dataset.jsonl - Main dataset with judge scores and oracle labels (4,961 prompts)
prompts.jsonl - Original Chatbot Arena prompts
responses/ - Model responses for each policy variant
logprobs/ - Token logprobs for importance sampling estimators
base - No system prompt
clone - "Respond exactly as… See the full description on the dataset page:
https://huggingface.co/datasets/elandy/cje-chatbot-arena.