Views
No views yet
| 항목 | 값 |
|---|---|
| 기반 모델 | Qwen/Qwen3.5-122B-A10B |
| 전체 파라미터 | 122B (활성 파라미터: 10B, MoE) |
| 양자화 | FP8 E4M3, 블록 크기 [128, 128] |
| 모델 크기 | 약 118 GB |
| 아키텍처 | 48 하이브리드 레이어: 36 GDN (Gated Delta Net) + 12 Full Attention, 전체 MoE |
| 전문가 수 | 256개 (토큰당 8개 라우팅 + 1개 공유) |
| 최대 컨텍스트 | 262,144 토큰 |
| 지원 언어 | 한국어, 영어, 다국어 |
1vllm serve prosoft0405/Kosmic-122B-A10B-FP8 \
2 --tensor-parallel-size 2 \
3 --trust-remote-code \
4 --max-model-len 327681from openai import OpenAI
2client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
3
4response = client.chat.completions.create(
5 model="prosoft0405/Kosmic-122B-A10B-FP8",
6 messages=[
7 {"role": "system", "content": "You are Kosmic, an AI assistant developed by Prosoft."},
8 {"role": "user", "content": "안녕하세요! 자기소개 해주세요."}
9 ],
10 max_tokens=1024,
11 temperature=0.7,
12)
13print(response.choices[0].message.content)ollama run prosoft0405/kosmic-122b| 구성 | 최소 요구 |
|---|---|
| GPU VRAM | 약 120 GB (TP=2: 60 GB × 2장) |
| 권장 GPU | RTX PRO 6000 Blackwell × 2, A100 80GB × 2, H100 × 2 등 |