Views
No views yet
| 항목 | 이전 (MultiDomain) | 이 모델 (KoreanCoding) |
|---|---|---|
| 한국어 전문가/layer | ~24 (가중치 조합) | ~52 (경량 할당) |
| 코딩 전문가/layer | ~25 (가중치 조합) | 100 (경량 할당) |
| VLM 전문가 | 포함 (76% 보존) | 제외 (언어+코딩에 재할당) |
| 한국어 라우터 부스트 | 없음 | gate.weight × 1.15 |
| 할당 방식 | 가중 결합 (soft) | 카테고리별 경량 (hard) |
| 카테고리 | 할당 | 보호 방식 |
|---|---|---|
| 🇰🇷 한국어 | top-50 (hard) | gate.weight ×1.15 부스트 |
| 🇯🇵 일본어 | top-20 (hard) | 한국어와 공유 시 부스트 |
| 💻 코딩 | top-100 (hard) | SWE-bench/HumanEval 보존 |
| 🇨🇳 중국어 | top-20 (hard) | 중국어 생성 보존 |
| 🌐 일반 | ~22 (weight_norm) | 영어/기본 추론 |
| 🖼️ VLM | 제외 | Image-to-Text 불가 |
1python3 -m sglang.launch_server \
2 --model-path /path/to/Ornith-1.0-397B-FP8-KoreanCoding-Expert192 \
3 --tp 2 --trust-remote-code \
4 --reasoning-parser qwen3 --tool-call-parser qwen3_coder \
5 --max-model-len 262144 --chunked-prefill-size 8192 \
6 --mem-fraction-static 0.88 \
7 --host 0.0.0.0 --port 30000| 구분 | 용량 |
|---|---|
| 가중치 (192 experts FP8) | ~152 GB |
| 런타임 | ~13 GB |
| KV-Cache | ~27 GB (256K × 7 동시) |