model_arc_challenge.py 是针对 Qwen2.5 模型的相关推理代码,用于运行 ARC 基准测试。该基准测试的重点是评估生成的答案在科学推理和常识问答任务中的表现。
eval_arc_challenge.py 是针对推理结果的评分代码,主要通过正则表达式来解析和评估生成结果。
ARC 数据集以中学生考试中的科学问题为核心,主要测试模型在常识推理和科学问答任务上的能力。
数据集分为多项选择题形式,每个问题提供若干个选项,要求模型选择最合适的答案。
ARC-Challenge… See the full description on the dataset page:
https://huggingface.co/datasets/zrchen03/ARC_Challenge.