Views
No views yet
Hengzongshu/chinese-bbpe-vocab/
├── tokenizer.json # 分词器配置文件(核心文件)
└── README.md # 当前 Model Cardtokenizers 库直接加载 tokenizer.json 文件(需要下载到本地):1from tokenizers import Tokenizer
2
3# 加载分词器
4tokenizer = Tokenizer.from_file("tokenizer.json") #你的tokenizer.json文件位置
5
6# 分词示例
7encoded = tokenizer.encode("自然语言处理")
8print(encoded.tokens)
9print(encoded.ids) transformers.AutoTokenizer 加载本仓库,因为其需要模型配置文件(config.json),而本仓库未提供:1# ❌ 报错示例(缺少 config.json)
2from transformers import AutoTokenizer
3tokenizer = AutoTokenizer.from_pretrained("Hengzongshu/chinese-bbpe-vocab")tokenizer.json),不包含模型权重。请勿将其与完整模型仓库混淆。tokenizers 库(Hugging Face 官方库)加载分词器。pip install tokenizerstokenizer.json 文件实际存在于指定路径,否则会报 FileNotFoundError。tokenizer.get_vocab_size() 查看。[unk]、[s]、[pad] 等常见特殊标记(如需自定义,请修改 tokenizer.json)。