allganize/RAG-Evaluation-Dataset-KO의 한국어 RAG 300 Q&A 위에 46개 답변 생성 모델의 답변과 LLM-as-Judge 평가 결과를 얹은 데이터셋입니다. 원문 문항·기준 답변·출처 PDF 메타데이터는 allganize 데이터셋을 그대로 따릅니다.
RAG 파이프라인 최적화 > 모델 업그레이드. 동일 GPT-5.4를 쓰면서도 검색 파이프라인만 잘 짜면 GPT-5.4-pro(약 10배 비싼 모델)보다 +6.0pp 높은 정확도(0.827) 를 낸다.