Views
No views yet
optimum-cli export openvino --model HuggingFaceTB/SmolLM3-3B \
--weight-format int8 --sym --group-size -1 <output_dir>| Device | Decode | vs int4-cw |
|---|---|---|
| NPU | 12.3 tok/s | 23.3 |
| iGPU | 16.8 tok/s | 29.7 |
| CPU | 22.7 tok/s | 37.5 |
1import openvino_genai as og
2pipe = og.LLMPipeline("SmolLM3-3B-int8-cw-ov", "NPU", MAX_PROMPT_LEN=4096)
3print(pipe.generate("Hello!", og.GenerationConfig(max_new_tokens=64)))python nollama.py --model-dir ~/models/SmolLM3-3B-int8-cw-ov.