Blossom Orca V2版本已发布!🤗
Blossom Orca V1是一个基于OpenOrca衍生而来的中英双语指令数据集,适用于指令微调。
本数据集从OpenOrca中抽取了系统提示和指令,首先将其翻译为中文并校验翻译结果,再使用指令调用gpt-3.5-turbo-0613模型生成响应,并过滤掉包含自我认知以及拒绝回答的响应,以便后续对齐。此外,为了确保响应风格的一致性以及中英数据配比,本数据集还对未翻译的原始指令也进行了相同的调用,最终得到了1:1的中英双语指令数据。
相比直接对原始OpenOrca进行翻译的中文数据集,Blossom Orca的一致性及质量更高。
本次发布了全量数据的30%,包含中英双语各100K,共计200K记录。
以中文和英文为主。
数据集结构… See the full description on the dataset page: https://huggingface.co/datasets/Azure99/blossom-orca-v1.