Views
No views yet
| ソースモデル | 本モデル | |
|---|---|---|
| 総パラメータ | ~32B | ~62.3B |
| アクティブパラメータ | ~3.8B | ~5.7B |
| エキスパート数 | 128 | 256 |
| アクティブエキスパート/トークン | 8 (top-8) | 16 (top-16) |
| アーキテクチャ | Qwen3MoE | Qwen3MoE |
| Hidden size | 2560 | 2560 |
| Expert intermediate size | 960 | 960 |
| レイヤー数 | 32 | 32 |
| Attention heads | 40 (GQA 4 KV heads) | 40 (GQA 4 KV heads) |
| 語彙数 | 196,608 | 196,608 |
| 最大コンテキスト長 | 65,536 | 65,536 |
| 精度 | bfloat16 | bfloat16 |
llm-jp/llm-jp-4-32b-a3b-base からそのまま移植llm-jp/llm-jp-4-32b-a3b-thinking からそのまま移植[128, 2560] × 2 を [256, 2560] に連結Qwen3MoeForCausalLM
├── embed_tokens: [196608, 2560] # SLERP merged
├── layers × 32
│ ├── self_attn (GQA) # SLERP merged
│ │ ├── q_proj: [5120, 2560]
│ │ ├── k_proj: [512, 2560]
│ │ ├── v_proj: [512, 2560]
│ │ └── o_proj: [2560, 5120]
│ ├── mlp (MoE)
│ │ ├── gate (router): [256, 2560] # Concatenated
│ │ └── experts × 256 # 0-127: base, 128-255: thinking
│ │ ├── gate_proj: [960, 2560]
│ │ ├── up_proj: [960, 2560]
│ │ └── down_proj: [2560, 960]
│ ├── input_layernorm # SLERP merged
│ └── post_attention_layernorm # SLERP merged
├── norm # SLERP merged
└── lm_head: [196608, 2560] # SLERP merged1vllm serve aixsatoshi/llm-jp-4-64b-a6b-merged \
2 --trust-remote-code \
3 --tensor-parallel-size 41from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_id = "aixsatoshi/llm-jp-4-64b-a6b-merged"
4
5tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
6model = AutoModelForCausalLM.from_pretrained(
7 model_id,
8 torch_dtype="bfloat16",
9 device_map="auto",
10 trust_remote_code=True,
11)
12
13messages = [{"role": "user", "content": "日本の首都はどこですか?"}]
14inputs = tokenizer.apply_chat_template(messages, return_tensors="pt", add_generation_prompt=True)
15inputs = inputs.to(model.device)
16
17outputs = model.generate(inputs, max_new_tokens=256)
18print(tokenizer.decode(outputs[0][inputs.shape[-1]:], skip_special_tokens=True))