Views
No views yet
neureps/Qwen3.5-0.8B-enko) 한국어 댓글 증류 어댑터.
Kanana-1.5-8B 교사 증류(QLoRA)로 0.8B의 한국어 댓글 품질을 끌어올리는 트랙.
개선 트랙이라 버전 폴더(v1/, v2/, …)로 관리한다 — 게이트 통과 버전만 병합·재양자화 GGUF로 승격한다.자매 리포: 2B 증류 =neureps/warmly-qwen35-2b-enko-distill· GGUF =neureps/warmly-qwen35-08b-enko-ggufvariants/· 데이터 =neureps/warmly-distill-data
| 버전 | 폴더 | 채택 체크포인트 | 레시피 | 결과(실측) | 상태 |
|---|---|---|---|---|---|
| v1 (2026-07-15) | v1/ | epoch2 (step 812) | QLoRA r16/α32, 3epoch 중 epoch2 채택, completion-only, lr 2e-4, maxlen 512, target q,k,v,o,gate,up,down. 데이터 = warmly-distill-data v1(train 6,483, 전부 단일턴) | 블라인드 승률 ~79% vs 0.8B base, 어색 ~27→~12/60, 에폭 붕괴 없음. 1GB 언더 스택 501MB 실증(IQ4_XS 395 + mmproj q8 111) | 측정 성공(레시피 이식성 입증) · 현 상태 배포 부적합 — 아래 |
| v2 (2026-07-16) | v2/ | epoch2 (step 1420) | 입력 커버리지 보강 — v1 + 캡션 리치화(실추론 분포 정합)·KO 브리지·anti-foreign·답글/자기비하 증강. QLoRA r16/α32, maxlen 768, train 11,360. 데이터 warmly-distill-data v2 | 자기비하 동조 0·영어누출 0/60·지명환각 11→0/60(vs v1). 하드캡션 접지 개선(최난도 희귀어는 용량 바운드 잔존) | ★ 배포 가능 폴백 — v1의 두 차단 요인(자기비하·누출/환각) 해결 |
.venv-qlora = transformers git-main 5.14.dev)1from transformers import AutoModelForImageTextToText, AutoTokenizer
2from peft import PeftModel
3base = "neureps/Qwen3.5-0.8B-enko"
4tok = AutoTokenizer.from_pretrained(base)
5model = AutoModelForImageTextToText.from_pretrained(base, dtype="float16", device_map="cuda")
6model = PeftModel.from_pretrained(model, "neureps/warmly-qwen35-08b-enko-distill", subfolder="v1")
7model = model.merge_and_unload() # peft 병합은 MTP를 드롭 — 정상qwen3_5)는 transformers git-main(5.14.dev)부터만 로드 가능. 생성 시 enable_thinking=False 필수(안 끄면 전 토큰이 reasoning으로 소모). GGUF 변환은 --no-mtp + chkhsh 2ea57f…a677a→qwen35 패치.louie/ ★배포 페르소나 어댑터(채택 e1) · louie-r25/ 리플레이 실험 · v3c-p5/ 5인 blend 실험 · v3c-merged/ 배포 소형 병합 f16(재양자화 유일 원천).MODEL-REGISTRY.md, 데이터 = neureps/warmly-distill-data.