Views
No views yet
LiquidAI/LFM2.5-2.6B quantized to INT8 for Intel AI Boost NPU.mosesman/LFM2.5-2.6B-openvino-int4-npu) compiled on NPU but crashed on the first generate() with OpenVINO 2026.3 (invalid unordered_map key). This INT8 export generates correctly on NPU with OpenVINO 2026.4 nightly (verified 2026.4.0.dev20260818 on Core Ultra 7 256V).pip install --pre openvino openvino-tokenizers openvino-genai --extra-index-url https://storage.openvinotoolkit.org/simple/wheels/nightly1import openvino_genai as ov_genai
2from transformers import AutoTokenizer
3
4model_id = "mosesman/LFM2.5-2.6B-openvino-int8-npu"
5device = "NPU" # or "GPU" / "CPU"
6
7tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
8prompt = tokenizer.apply_chat_template(
9 [{"role": "user", "content": "What is 17*19? Reply with only the number."}],
10 tokenize=False,
11 add_generation_prompt=True,
12)
13
14pipe = ov_genai.LLMPipeline(model_id, device)
15config = ov_genai.GenerationConfig()
16config.max_new_tokens = 128
17config.do_sample = False # NPU: greedy only
18
19print(pipe.generate(prompt, config))