DSBC : Data Science task Benchmarking with Context Engineering
This repository evaluates Large Language Models on the DSBC (Data Science Benchmarking) dataset. It systematically tests LLM capabilities in data science code generation by generating responses to complex data science questions and evaluating them using LLM-based judges.
Github repository for evaluation: https://github.com/traversaal-ai/DSBC-Data-Science-Task-Evaluation/
Evaluation Results… See the full description on the dataset page: https://huggingface.co/datasets/large-traversaal/DSBC-Queries-V2.0.