Views
No views yet
1[project]
2name = "export"
3version = "0.1.0"
4description = "Export models"
5readme = "README.md"
6requires-python = "==3.12.*"
7dependencies = [
8 "openvino==2025.2.0",
9 "optimum[openvino]",
10 "optimum-intel",
11 "openvino-genai",
12 "huggingface-hub==0.33.0",
13 "tokenizers==0.21.1"
14]1uv sync
2uv run optimum-cli export openvino --model microsoft/phi-4-mini-instruct --task text-generation-with-past --weight-format int4 --group-size -1 --ratio 1.0 --sym --trust-remote-code phi-4-mini-instruct/INT4-NPU_compressed_weights pip install -U openvino openvino-tokenizers openvino-genai
pip install huggingface_hubimport huggingface_hub as hf_hub
model_id = "bweng/phi-4-mini-instruct-int4-ov-npu"
model_path = "phi-4-mini-instruct-int4-ov"
hf_hub.snapshot_download(model_id, local_dir=model_path)import openvino_genai as ov_genai
device = "NPU"
pipe = ov_genai.LLMPipeline(model_path, "NPU", MAX_PROMPT_LEN=4096, CACHE_DIR="./cache")
# Create a proper GenerationConfig object
gen_config = GenerationConfig(apply_chat_template=True, max_new_tokens=1024)
# Now call generate with the correct config object
output = pipe.generate("How are you doing?", generation_config=gen_config)
print(output)