Dataset Card for "compred"
Dataset Details
Dataset Description
Conventional algorithms for training language models (LMs) with human feedback rely on preferences that are assumed to account for an average user,
disregarding subjectivity and finer-grained variations. Recent studies have raised concerns about aggregating such diverse, often contradictory human feedback to train
a single universal reward model, questioning which values or voices the models align… See the full description on the dataset page: https://huggingface.co/datasets/allenai/compred.