In our comprehensive evaluation covering 164 unique configurations, base models frequently suffered from "Formatting Hallucinations" (e.g., wrapping outputs in Markdown tags), resulting in zero scores within strict execution environments.
For detailed evaluation logs, pass rates, and the full experimental matrix, please refer to our
Evaluation Logs Dataset.