Views
No views yet
| File | Format | Size | Description |
|---|---|---|---|
eagle3_draft_f16.gguf | GGUF F16 | 470 MB | Draft model in F16 precision |
eagle3_draft_q8.gguf | GGUF Q8_0 | 238 MB | Draft model quantized to Q8_0 |
hf_model/ | safetensors | 896 MB | Hugging Face format for fine-tuning |
1# Basic usage with speculative decoding
2llama-cli \
3 -m Qwen3-0.6B-target.gguf \
4 -md eagle3_draft_q8.gguf \
5 --spec-type draft-eagle3 \
6 --spec-draft-n-max 5 \
7 -p "Hello, how are you?" \
8 -n 200
9
10# Server mode (enables Ollama-like API)
11llama-server \
12 -m Qwen3-0.6B-target.gguf \
13 -md eagle3_draft_q8.gguf \
14 --spec-type draft-eagle3 \
15 --spec-draft-n-max 5 \
16 --port 8080ollama pull qwen3:0.6b1FROM qwen3:0.6b
2DRAFT_MODEL ./eagle3_draft_q8.gguf
3PARAMETER speculative_type draft-eagle3
4PARAMETER speculative_draft_max 51ollama create qwen3-eagle -f Modelfile
2ollama run qwen3-eagle| Config | Speed (t/s) | vs Baseline |
|---|---|---|
| Baseline (no draft) | 33.2 | 1.00x |
| Ngram (len=3) | 34.6 | 1.04x |
| EAGLE-3 (len=3) | 15.6 | 0.47x |
| EAGLE-3 (len=5) | 11.8 | 0.36x |
Note: EAGLE-3 speedup requires GPU acceleration. On CPU-only, the dual-model overhead outweighs speculation benefits for small models (0.6B). Speedup expected with GPU offloading or larger target models.