中文长上下文 + 多轮对话训练数据,用于 Xinhe (心核)
项目让小型 Transformer 在 fast-weights NeuralMemory 中习得长程记忆能力
(v9.5 paper-faithful Titans MAC + LoRA + per-layer K/V)。
包含五个 config:
skeleton:11 种合成骨架对话(needle-in-haystack 写读 / 覆写 / 删除 / stale-read 对抗),
v9.5 起 S1/S2/S5/S7/S9/S10/S11 切到 paragraph distract(从 congliu 短答 bank 拼成长段),
用于 sanity probe + 长 episode 压力
dialog:LLM(DeepSeek / OpenRouter)生成的 5-Beat 自然多轮对话,真实分布代理
novel:中文长篇小说按 ~350 字 raw chunking,每 episode = 8 个章内连续 chunk… See the full description on the dataset page:
https://huggingface.co/datasets/flufy3d/xinhe-dataset.