Views
No views yet
| Model | Params | Quantization | Size | NPU Performance |
|---|---|---|---|---|
| Llama 3.2 1B Instruct | 1B | W4 | ~1.0 GB | ~23 tok/s on S25 |
| Qwen 2.5 7B Instruct | 7B | W8A16 | ~3.9 GB | ~5-8 tok/s on S25 |
1# Llama 3.2 1B (recommended for fast inference)
2wget https://huggingface.co/runanywhere/genie-npu-models/resolve/main/llama-3.2-1b-instruct-genie-w4.tar.gz
3
4# Qwen 2.5 7B (higher quality, slower)
5wget https://huggingface.co/runanywhere/genie-npu-models/resolve/main/qwen2.5-7b-instruct-genie-w8a16.tar.gzgenie_config.json -- Genie SDK configurationhtp_backend_ext_config.json -- HTP backend config (Snapdragon 8 Elite, v79)tokenizer.json -- Model tokenizer*_part_N_of_M.bin -- QNN context binary parts