team-hatakeyama-phase2/LLMChatの2つのモデルの応答に対して、様々なモデルを用いてPairwise評価を行った結果のデータです。
人手評価とオープンLLMによる自動評価の一致率の検証のために作成しました。詳細についてはこちらの記事を確認してください。
元のデータセットであるteam-hatakeyama-phase2/LLMChatに準じます。一部出力を使ったモデルの学習が禁止されているものもあるのでご注意ください。
その他の詳細については元データセットをご確認ください。