Views
No views yet
| Property | Value |
|---|---|
| Base model | deepreinforce-ai/Ornith-1.0-35B |
| Architecture | Qwen3.5 MoE (256 experts, 8 active) |
| Parameters | 35B |
| Context window | 196,608 tokens |
| Quantization | INT4, group_size=128, symmetric |
| Packing format | auto_round:auto_gptq |
| AutoRound version | 0.14.3 |
| Calibration | 512 samples, 1000 iters |
qwen3_xml format (OpenAI-compatible)<think>...</think> blocks| Benchmark | Score |
|---|---|
| SWE-bench Verified | 75.6% |
| SWE-bench Pro | 50.4% |
| Terminal-Bench 2.1 | 64.2% |
| NL2Repo | 34.6% |
| Claw-eval Average | 69.8% |
1vllm serve cyburn/Ornith-1.0-35B-int4-AutoRound \
2 --served-model-name qwen/qwen3.5 \
3 --load-format instanttensor \
4 --tensor-parallel-size 1 \
5 --gpu-memory-utilization 0.80 \
6 --kv-cache-dtype fp8 \
7 --max-model-len 196608 \
8 --max-num-batched-tokens 16384 \
9 --attention-backend FLASHINFER \
10 --quantization compressed-tensors \
11 --enable-prefix-caching \
12 --enable-chunked-prefill \
13 --enable-auto-tool-choice \
14 --tool-call-parser qwen3_xml \
15 --reasoning-parser qwen3 \
16 --chat-template chat_template.jinja \
17 --generation-config auto \
18 --trust-remote-code1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "cyburn/Ornith-1.0-35B-int4-AutoRound",
5 device_map="auto",
6 trust_remote_code=True,
7)
8tokenizer = AutoTokenizer.from_pretrained("cyburn/Ornith-1.0-35B-int4-AutoRound")bits=4, group_size=128, sym=True, iters=1000, nsamples=512
packing_format=auto_round:auto_gptq