raw/yuhua_raw.jsonl:原始语料(13 册 20952 段,含 book/chapter/segment_index 元数据)
v4/yuhua_cot_*:优化后 CoT 训练数据(合计 2302 条,train=2072 / val=230)
yuhua_cot_long.jsonl:700 条章节拼接长文本正例(正文 800-1500 字,解决长文本生成瓶颈)
*_sg.jsonl:sharegpt 格式(LLaMA-Factory 直接可用)
人名符号化(a1/a2 等),生成时提示词映射实现人物可控
长文本:700 条 800-1500 字真实余华长文正例
强约束… See the full description on the dataset page:
https://huggingface.co/datasets/shikunpunk/YuHua-Qwen3-V4-Data.