会话 / 时序 / 并发:来自 Mooncake trace(以 hash 去尾满块前缀重建会话,保留每轮真实 timestamp);
内容:来自 lightseekorg/kimi-mtp-dataset(真实多轮对话),按会话逐轮填入;不复刻 Mooncake 的 512 块量化,复用关系由
内容决定、与缓存配置无关。
闭环回放:数据只存每轮用户输入与时间结构,不预拼 prompt;回放(bench/replay.py)按会话维护
上下文——第 k+1 轮 = 前 k 轮(用户输入 + 模型现场生成的回复)累积,助手回复由真实模型生成、不用
预录答案;输出长度不预设(统一 max_tokens 上限 + 自然 EOS)。
按 Mooncake config 分:conversation, mooncake… See the full description on the dataset page:
https://huggingface.co/datasets/weijiezz/foretoken-trace.