Views
No views yet
ibm-granite/granite-4.1-3b,
quantized with INT4 RTN, block size 32, accuracy level 4.1python -m onnxruntime_genai.models.builder \
2 --model_name ibm-granite/granite-4.1-3b \
3 --precision int4 \
4 --execution_provider cpu \
5 --extra_options int4_block_size=32 int4_accuracy_level=4 int4_algo_config=rtnGroupQueryAttention and avoids the repeat_kv
shape/cache failure observed with the previous conversion based on
onnx-community/Granite-4.1-3b-Onnx.genai_config.jsonmodel.onnxmodel.onnx.datatokenizer.jsontokenizer_config.jsonchat_template.jinjaquantization_config.json