Views
No views yet
| Property | Value |
|---|---|
| Base model | kshitijthakkar/qwen3.5-moe-0.87B-d0.8B |
| Layers | 24 |
| Hidden size | 2048 |
| Experts | 8 total, top-2 active |
| Total parameters | 2914 M |
| Attention | Hybrid (GatedDeltaNet + Gated Full Attention) |
1from transformers import AutoModelForImageTextToText, AutoProcessor
2
3model = AutoModelForImageTextToText.from_pretrained(
4 "kshitijthakkar/qwen3.5-0.8b-moe-from-scratch",
5 torch_dtype="bfloat16",
6 device_map="auto",
7)
8processor = AutoProcessor.from_pretrained("kshitijthakkar/qwen3.5-0.8b-moe-from-scratch")
9
10messages = [{"role": "user", "content": "Explain the Qwen3.5 architecture."}]
11inputs = processor.apply_chat_template(
12 messages, add_generation_prompt=True,
13 tokenize=True, return_dict=True, return_tensors="pt"
14).to(model.device)
15
16outputs = model.generate(**inputs, max_new_tokens=200)
17print(processor.decode(outputs[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True))qwen3_5_from_scratch.ipynb
for the full from-scratch implementation.