한국어 피싱 이메일 탐지를 위해 Mistral-7B-Instruct-v0.3를 LoRA 파인튜닝한 모델입니다.
NIPA 2026 오픈소스 AI·SW 활용 지원사업 (CAiON SecOps) PoC 산출물로,
실제 보안 운영 환경(ISMS 인증 기업)에서 수집한 데이터로 학습하고 검증했습니다.
피싱 이메일을 입력하면 실시간으로 분류 → 위협 분석 → 에이전틱 조치 제안까지 확인할 수 있습니다.
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base = AutoModelForCausalLM.from_pretrained(
5 "mistralai/Mistral-7B-Instruct-v0.3",
6 load_in_4bit=True,
7 device_map="auto",
8)
9model = PeftModel.from_pretrained(base, "joohans/mistral-7b-phishing-ko")
10tokenizer = AutoTokenizer.from_pretrained("mistralai/Mistral-7B-Instruct-v0.3")
11
12prompt = "[INST] 다음 이메일이 피싱인지 판단하세요.\n\n{email_text} [/INST]"
1from huggingface_hub import hf_hub_download
2from ctransformers import AutoModelForCausalLM
3
4gguf_path = hf_hub_download(
5 repo_id="joohans/mistral-7b-phishing-ko",
6 filename="mistral-7b-phishing-ko-Q4_K_M.gguf",
7)
8llm = AutoModelForCausalLM.from_pretrained(
9 gguf_path, model_type="mistral",
10 context_length=2048, threads=4,
11)
일반적인 피싱 탐지 모델은 영어 데이터 위주로 학습되어 한국어 피싱 메일의 특성을 반영하지 못합니다.
MIT License — 상업적 사용 포함 자유롭게 활용 가능합니다.
CPLabs (주식회사 씨피랩스) — NIPA 2026 오픈소스 AI·SW 활용 지원사업