Views
No views yet
compressed/ # drafter weights + config (LlamaForCausalLMEagle3)
patch_sglang_eagle3.py # one-shot patch: adds the EAGLE-3 aux-hidden capture
# hook to SGLang's qwen3_5.py (needed for ANY drafter
# on a qwen3_5-family target)
serve_sglang.sh # launch helper1huggingface-cli download VirVen/Qwen3.5-27B-EAGLE3-v2 --local-dir .
2pip install "sglang>=0.5.12"
3python3 patch_sglang_eagle3.py
4MODEL=Qwen/Qwen3.5-27B-FP8 DRAFTER=./compressed ./serve_sglang.sh1SGLANG_ENABLE_SPEC_V2=1 python3 -m sglang.launch_server \
2 --model-path Qwen/Qwen3.5-27B-FP8 \
3 --speculative-algorithm EAGLE3 \
4 --speculative-draft-model-path ./compressed \
5 --speculative-num-steps 3 \
6 --speculative-eagle-topk 1 \
7 --speculative-num-draft-tokens 4 \
8 --mamba-scheduler-strategy extra_buffer \
9 --mm-attention-backend sdpa \
10 --dtype bfloat16 --trust-remote-codeQwen/Qwen3.5-27B-FP8 (Qwen3-32B architecture, FP8)