Avaliação do pipeline de RAG da Cemig pelo LightEval, através de um
endpoint compatível com OpenAI. O RAG é avaliado como se fosse um modelo:
mesmo runner, mesmas tasks e mesmas métricas usadas nos modelos puros.
Uma linha por (experimento, modelo, task, métrica). A coluna model_name
é o nome do experimento — decoder-only é a baseline sem recuperação, e
rag-
[-] identifica a combinação usada.… See the full description on the dataset page: https://huggingface.co/datasets/juliadollis/energy-mcq-harder-lighteval-rag-base-qwen3-4b.