大语言模型在通用语料与若干垂直场景中已表现出卓越性能。中国保险行业兼具高度监管、强风险敏感与专业知识密集等特征,亟需一套系统化、可复现的评测框架,以客观衡量大模型在保险任务中的真实能力。现有金融领域评估基准虽然为行业提供初步评估工具,但在保险学科知识体系覆盖的完整性、专业深度及评估维度的全面性方面仍有不足,特别是缺乏对保险精算、合规安全、逻辑严谨性等核心领域的深入评估。
随着近两年大模型与评测项目发展,尽管已有研究团队发布金融大模型应用评测报告以及提出面向保险行业的多模态模型评估基准,但一个全面覆盖保险理论知识体系、注重专业严谨性且基于专家驱动的专业评测基准仍然缺位。… See the full description on the dataset page:
https://huggingface.co/datasets/CUFEInse/CUFEInse.