Views
No views yet
| 파일 | 모델 | 학습 출처 | 성격 |
|---|---|---|---|
sjw_sillok.ckpt | 승정원일기·실록 모델 | 조선왕조실록·승정원일기·고순종실록 | 고재현·저정밀 |
jonghap.ckpt | 종합 모델 | 위 + 한국사료총서·고려사·고려사절요·삼국사기·삼국유사 | 저재현·고정밀 |
| 모델 | F1 | Precision | Recall |
|---|---|---|---|
| 승정원일기·실록 모델 | 0.9049 | 0.8982 | 0.9118 |
| 종합 모델 | 0.8915 | 0.8803 | 0.9030 |
AutoModelForTokenClassification이 아니라 SikuRoBERTa 인코더 위에 3-클래스 선형 분류기를 얹은 구조로, PyTorch Lightning 체크포인트(.ckpt)로 배포됩니다. 로딩·추론·앙상블 병합은 GitHub 저장소의 NER_model_loader.py와 4_NER_추론_txt.py를 사용하는 것이 표준입니다.1huggingface-cli download yachagye/korean-historical-placename-ner sjw_sillok.ckpt jonghap.ckpt --local-dir ./ckpt
2python 4_NER_추론_txt.py # 모드·입력 방식 선택 후 두 ckpt 지정 → 통합본 생성1import torch
2from transformers import AutoTokenizer, AutoModel
3
4tok = AutoTokenizer.from_pretrained("SIKU-BERT/sikuroberta")
5enc = AutoModel.from_pretrained("SIKU-BERT/sikuroberta")
6classifier = torch.nn.Linear(enc.config.hidden_size, 3) # 0=O, 1=B-LOC, 2=I-LOC
7# ckpt의 state_dict에서 인코더·분류기 가중치를 복원 (NER_model_loader.py 참조)[ ]로 표시한 한문 텍스트입니다.[竹山縣]
東至[陰竹縣]界二十二里,南至[忠淸道][鎭川縣]界二十六里,西至[安城郡]界二十三里…路·內·西 등 비지명 1글자)과 선행 허사 흡수(隷 류)가 통합본에 남을 수 있습니다. 이는 지명 경계가 본래 확정적이지 않은 자료 특성의 표면화로, 다운스트림 정제에서 거릅니다.京 등)은 문맥 의존 판정이 필요합니다.1@article{yang_placename_ner,
2 author = {양정현},
3 title = {색인 XML 사료를 활용한 한국 역사 지명 개체명 인식 모델의 구축},
4 journal = {한국사학보},
5 number = {104},
6 year = {2026},
7 note = {면수·DOI 확정 시 갱신 예정}
8}NOTICE 참조). 학습에 사용한 색인 XML 사료는 재배포하지 않으며, 원본은 국사편찬위원회·공공데이터포털의 이용 조건을 따릅니다.