Views
No views yet
[!NOTE] This version has extended thinking length. Recommended for highly complex reasoning tasks.

| Key | Value |
|---|---|
| Modality | Text |
| Training Stage | Posttraining |
| Params(Total / Activated) | 21B / 3B |
| Layers | 28 |
| Heads(Q/KV) | 20 / 4 |
| Text Experts(Total / Activated) | 64 / 6 |
| Shared Experts | 2 |
| Context Length | 131072 |
1python -m fastdeploy.entrypoints.openai.api_server \
2 --model AdvRahul/Axion-Thinking-21B-A3B \
3 --port 8180 \
4 --metrics-port 8181 \
5 --engine-worker-queue-port 8182 \
6 --load_choices "default_v1" \
7 --tensor-parallel-size 1 \
8 --max-model-len 131072 \
9 --reasoning-parser axion_x1 \
10 --tool-call-parser axion_x1 \
11 --max-num-seqs 32
12vllm serve AdvRahul/Axion-Thinking-21B-A3B
13
14import torch
15from transformers import AutoModelForCausalLM, AutoTokenizer
16
17model_name = "AdvRahul/Axion-Thinking-21B-A3B"
18
19tokenizer = AutoTokenizer.from_pretrained(model_name)
20model = AutoModelForCausalLM.from_pretrained(
21 model_name,
22 device_map="auto",
23 torch_dtype=torch.bfloat16,
24)
25
26prompt = "Give me a short introduction to large language models."
27messages = [{"role": "user", "content": prompt}]
28text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
29model_inputs = tokenizer([text], add_special_tokens=False, return_tensors="pt").to(model.device)
30
31generated_ids = model.generate(**model_inputs, max_new_tokens=1024)
32output_ids = generated_ids[0][len(model_inputs.input_ids[0]):].tolist()
33generate_text = tokenizer.decode(output_ids, skip_special_tokens=True)
34print("generate_text:", generate_text)