OLMo3-190M-zh-v2 Base Tokenized Data
这是 OLMo3-190M 中文 v2 base pretrain 使用的正式 tokenized 数据。
本仓库只发布 packed token id,不发布 raw text shards。这样可以让训练复现直接读取 tokenized.bin,同时避免原始语料再分发带来的体积和授权边界问题。
tokenized.bin # uint16 一维 token 流
meta.json # 数据构建、混合比例、token 统计等元数据
本数据必须使用下面这个 tokenizer 解码和训练:
Nwna/olmo3-190m-zh-v2-tokenizer
不要用其他 tokenizer 读取这份 tokenized.bin。同一个数字 token id 在不同 tokenizer 里含义不同,混用会导致训练目标错位,即使 loss 下降也可能训练出坏模型。
数据摘要… See the full description on the dataset page: https://huggingface.co/datasets/Nwna/olmo3-190m-zh-v2-base-data.