Views
No views yet
Qwen/Qwen3-30B-A3B-Instruct-2507.| Base model | Qwen/Qwen3-30B-A3B-Instruct-2507 |
| Setting | games |
| Context length | 262,144 |
transformers.
With transformers<4.51.0, you will encounter the following error:KeyError: 'qwen3_moe'1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_name = "spade-rl/SPADE-Qwen3-30B-A3B-Games"
4
5tokenizer = AutoTokenizer.from_pretrained(model_name)
6model = AutoModelForCausalLM.from_pretrained(
7 model_name,
8 torch_dtype="auto",
9 device_map="auto"
10)
11
12prompt = "Give me a short introduction to large language model."
13messages = [{"role": "user", "content": prompt}]
14text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
15model_inputs = tokenizer([text], return_tensors="pt").to(model.device)
16
17generated_ids = model.generate(**model_inputs, max_new_tokens=16384)
18output_ids = generated_ids[0][len(model_inputs.input_ids[0]):].tolist()
19print(tokenizer.decode(output_ids, skip_special_tokens=True))sglang>=0.4.6.post1 or vllm>=0.8.5 to create an
OpenAI-compatible API endpoint:python -m sglang.launch_server --model-path spade-rl/SPADE-Qwen3-30B-A3B-Games --context-length 262144vllm serve spade-rl/SPADE-Qwen3-30B-A3B-Games --max-model-len 262144temperature=0.7, top_p=0.8, top_k=20, min_p=0, following
the sampling guidance on the base model card.