Views
No views yet
1from vllm import LLM
2
3llm = LLM(
4 model="Qwen/Qwen3-235B-A22B-Instruct-2507-FP8",
5 speculative_config={
6 "method": "eagle3",
7 "model": "nm-testing/Qwen3-235B-A22B-EAGLE3-converted-speculators-lmsys",
8 "num_speculative_tokens": 3,
9 },
10 tensor_parallel_size=2,
11)1python examples/offline_inference/spec_decode.py \
2 --method "eagle3" \
3 --tp 2 \
4 --model-dir "Qwen/Qwen3-235B-A22B-Instruct-2507-FP8" \
5 --eagle-dir "nm-testing/Qwen3-235B-A22B-EAGLE3-converted-speculators-lmsys" \
6 --num-spec-tokens 3LlamaForCausalLMEagle3 to Eagle3Speculatortransformer_layer_config and speculators_config sectionseagle_config.eagle_aux_hidden_state_layer_ids to top-level eagle_aux_hidden_state_layer_idsconfig.json: Model configuration in speculators formatmodel.safetensors: Model weights (unchanged from original)1@article{li2024eagle,
2 title={EAGLE-2: Faster Inference of Language Models with Dynamic Draft Trees},
3 author={Li, Yuhui and Wei, Fangyun and Zhang, Chao and Zhang, Hongyang},
4 journal={arXiv preprint arXiv:2406.16858},
5 year={2024}
6}