随着大语言模型(LLMs)在法律应用中的快速发展,系统评估其在法律文档处理和判决预测中的推理能力变得尤为迫切。目前公开的法律测评基准缺少统一的评估架构,对这两个任务的支持并不好。为填补这一空白,我们提出了 LawDual-Bench,填补了中文法律自然语言处理领域中结构化推理评估的关键空白,并为法律垂类大模型系统的评估与优化提供了坚实基础。更多详情可查看我们的论文。
LawDual-Bench 经精心设计,可以对大模型的法律文档理解和案情分析推理能力进行精确评估。我们设计了一套半自动化的数据集构建方案,通过人工+LLM的方式,构建了一个全面的内幕交易数据集,同时也可以很轻易地扩展数据集的数量与案情的种类。再次基础上,我们设计了结构化信息抽取 和 案件事实分析与判决预测… See the full description on the dataset page:
https://huggingface.co/datasets/Yuwh07/LawDual-Bench.