Views
No views yet
zh_core_web_trf(XLM-RoBERTa transformer)fine-tune。| 標籤 | 對應 PII 類型 | 範例 |
|---|---|---|
PERSON | 人名(NAME) | 王小明、歐陽娜娜、Mike Chen、Dr. 王 |
GPE | 地址 / 地理實體(ADDRESS) | 台北市信義區市府路 1 號、新北市板橋區文化路一段 200 號 |
其他 spaCy zh pipeline 元件(tagger / parser / attribute_ruler / transformer)凍結沿用 base model,未調整。
1pip install spacy huggingface_hub
2# 或
3uv pip install spacy huggingface_hub1from huggingface_hub import snapshot_download
2import spacy
3
4# Private repo 需先 login:huggingface-cli login
5model_path = snapshot_download(repo_id="anx2026/zh-tw-pii-ner-spacy-trf")
6nlp = spacy.load(model_path)
7
8doc = nlp("我叫王小明,住台北市信義區市府路 1 號。")
9for ent in doc.ents:
10 print(ent.text, ent.label_)
11# 王小明 PERSON
12# 台北市信義區市府路 1 號 GPE| Type | Precision | Recall | F1 |
|---|---|---|---|
| Overall | 0.914 | 0.914 | 0.914 |
| PERSON | 0.943 | 0.928 | 0.936 |
| GPE | 0.853 | 0.883 | 0.868 |
| Model | TP | FP | FN | Precision | Recall | F1 |
|---|---|---|---|---|---|---|
base zh_core_web_trf | 191 | 57 | 51 | 0.770 | 0.789 | 0.780 |
| fine-tuned(本模型) | 242 | 51 | 0 | 0.826 | 1.000 | 0.905 |
| Type | Model | P | R | F1 |
|---|---|---|---|---|
| NAME | base | 0.827 | 0.717 | 0.768 |
| NAME | fine-tuned | 0.837 | 1.000 | 0.911 |
| ADDRESS | base | 0.674 | 1.000 | 0.805 |
| ADDRESS | fine-tuned | 0.795 | 1.000 | 0.886 |
| 標籤 | 數量 |
|---|---|
| PERSON | 3297 |
| GPE | 1515 |
| 來源 | 數量 | 說明 |
|---|---|---|
| Templates(自製) | 3033 | 繁中模板 × 變體(複姓、外籍、暱稱、台灣常用地址格式) |
| WikiANN zh(簡轉繁) | 1191 | wikiann 中文切片,OpenCC 簡轉繁處理 |
| 項目 | 值 |
|---|---|
| Base model | zh_core_web_trf(spaCy 3.8) |
| Transformer | XLM-RoBERTa-base |
| Frozen components | tagger, parser, attribute_ruler |
| Trainable components | transformer, ner |
| Optimizer | Adam(β1=0.9, β2=0.999, L2=0.01) |
| LR schedule | warmup_linear, warmup=250, total=4000 |
| Initial LR | 5e-5 |
| Dropout | 0.1 |
| Max epochs | 8 |
| Batch size | 8(pad batcher size=2000) |
| Gradient accumulation | 3 |
| Patience | 1500 |
| Seed | 20260505 |
| GPU allocator | pytorch |
.
├── config.cfg # spaCy pipeline 設定
├── meta.json # 模型 metadata + scores
├── tokenizer # ChineseTokenizer (segmenter=char)
├── transformer/ # XLM-RoBERTa weights
├── ner/ # Fine-tuned NER head
├── tagger/ # 凍結,沿用 base
├── parser/ # 凍結,沿用 base
├── attribute_ruler/ # 凍結,沿用 base
└── vocab/ # spaCy vocabzh_core_web_trf(MIT)fine-tune,訓練資料含 WikiANN(CC-BY-SA 4.0)切片。下游使用請依各來源條款。@misc{zh_tw_pii_ner_spacy_trf_2026,
title = {zh-tw-pii-ner-spacy-trf: spaCy zh_core_web_trf fine-tuned for Traditional Chinese PII NER},
author = {AI NEXT MINE},
year = {2026},
url = {https://huggingface.co/anx2026/zh-tw-pii-ner-spacy-trf}
}