이 데이터셋은 강화 학습 기반 Quoridor AI 훈련을 위한 Self-Play 게임 기록으로 구성되어 있습니다.
각 샘플은 게임 중 하나의 상태(state), 해당 상태에서의 정책(policy), 그리고 그 상태의 가치(value)를 포함합니다.
승리한 에이전트의 모든 state 샘플에는 value = 1
패배한 에이전트의 모든 state 샘플에는 value = -1… See the full description on the dataset page:
https://huggingface.co/datasets/rwr9857/Quoridor-Data.