Views
No views yet
| Base model | Qwen/Qwen3-4B |
| Quantization | W8A8 (8-bit weights + 8-bit activations) |
| RKLLM version | 1.3.0 |
| Target SoC | RK3588 (3 NPU cores) |
| File size | 4.6 GB |
| Converted | 2026-06-23 |
1# Pull via rkllama (coming soon — manual install below in the meantime)
2rkllama pull ccarpinteri/Qwen3-4B-rk3588-rkllm-1.3.0Qwen3-4B_W8A8_RK3588.rkllm from this repo/path/to/rkllama/models/qwen3:4b/Qwen3-4B_W8A8_RK3588.rkllmModelfile alongside it:FROM="Qwen3-4B_W8A8_RK3588.rkllm"
HUGGINGFACE_PATH="Qwen/Qwen3-4B"
SYSTEM="You are a helpful assistant."
TEMPERATURE=0.71curl http://localhost:11434/api/generate \
2 -d '{"model":"qwen3:4b","prompt":"/no_think Hello! What can you help me with?","stream":false}'/no_think prefix for fast chat mode; /think to enable chain-of-thought reasoningr6a.xlarge (32GB RAM + 16GB swap):1from rkllm.api import RKLLM
2
3llm = RKLLM()
4llm.load_huggingface(model="./Qwen3-4B", device="cpu")
5llm.build(
6 do_quantization=True,
7 optimization_level=1,
8 quantized_dtype="w8a8",
9 quantized_algorithm="normal",
10 target_platform="rk3588",
11 num_npu_core=3,
12)
13llm.export_rkllm("./Qwen3-4B_W8A8_RK3588.rkllm")