space1637/safen-qwen3-4b
SAFEN-Bench SFT — 한국어 적대적 인포데믹 판정 모델. 풀 파인튜닝(LoRA 아님).
- 베이스:
Qwen/Qwen3-4B
- 학습쌍: 6,288 (검증 396, 변형축 10종 층화 분할)
- 손실: 어시스턴트 토큰에만 (프롬프트 마스킹)
- 정밀도: bf16 · epochs 4.0 · lr 1e-05
입력 신호의 출처 계보를 보고 신뢰 등급(L0 미확인 / L1 단일출처 / L2 교차확인 /
L3 공식확인), 도메인, 심각도, 권고 조치를 판정하고 시민용 3문답 메시지를 쓴다.
서로 다른 매체라도 같은 원출처를 받아쓴 것이면 독립 확인으로 세지 않는다.
학습 데이터는 합성이다. 실제 재난 사실로 인용하면 안 된다.