Views
No views yet
bert-chinese 是一个基于 BERT 的中文预训练语言模型,由作者自训练得到,整体效果在多个下游任务上略优于 Hugging Face 官方的 bert-base-chinese 模型,适用于中文文本分类、语义匹配、自然语言推理等任务。bert-base-chinese 相同的 BERT 架构(12 层 Transformer、768 隐藏维度、12 个注意力头),在中文语料上从头预训练,任务为 Masked Language Modeling(MLM)。| Task | bert-base-chinese | bert-chinese (本模型) | Random Init |
|---|---|---|---|
| iflytek | 58.18 | 59.25 | 36.36 |
| tnews | 56.59 | 56.79 | 50.74 |
| afqmc | 71.64 | 71.34 | 68.98 |
| cmnli | 79.47 | 80.17 | 58.58 |
✅ 评估任务包括中文文本分类(iflytek, tnews)、语义匹配(afqmc)、自然语言推理(cmnli)等,来自 CLUE benchmark。
pip install transformers1from transformers import BertTokenizer, BertForMaskedLM
2
3# 加载 tokenizer
4tokenizer = BertTokenizer.from_pretrained("51-wannt-to-be/bert-chinese")
5
6# 加载模型(Masked Language Model)
7model = BertForMaskedLM.from_pretrained("51-wannt-to-be/bert-chinese")
8
9# 示例输入
10text = "今天天气很好,我们去[MASK]吧!"
11inputs = tokenizer(text, return_tensors="pt")
12outputs = model(**inputs)
13
14# 获取预测结果
15logits = outputs.logits📌 如果你训练的是分类模型,可替换为BertForSequenceClassification来加载。
pytorch_model.bin:PyTorch 格式的模型权重config.json:模型结构配置vocab.txt:中文词表tokenizer_config.json:分词器配置special_tokens_map.json:特殊符号映射README.md:模型说明文档bert-chinese-cls、bert-chinese-ner 等)!欢迎继续交流 😄