🎉 First NPU-optimized Phi-4-mini model with correct quantization for Intel NPU!
Model Description
This is microsoft/Phi-4-mini-instruct (2.6B parameters) converted to OpenVINO IR format with NPU-specific INT4 symmetric quantization.
Key Difference from Standard OpenVINO Models
Critical Discovery: Intel NPU requires INT4_SYM (symmetric, channel-wise) quantization, not the INT4_ASYM (asymmetric, grouped) used by standard OpenVINO pre-converted models.
Quantization Type
NPU Compatibility
INT4_ASYM (group_size=64)
❌ FAILS (MatMul errors)
INT4_SYM (channel-wise)
✅ WORKS (this model)
Quantization Details
Method: INT4_SYM (symmetric)
Group size: -1 (channel-wise, not grouped)
Calibration: AWQ + scale_estimation on wikitext2 dataset
Discovery: Community finding on NPU quantization requirements
License
MIT (following base model license)
Model Card Contact
For issues or questions about NPU compatibility, please open an issue on the model repository.
Note: This model demonstrates the importance of quantization method selection for hardware-specific optimization. Always verify quantization parameters match target hardware requirements!