Views
No views yet
.pte export of google/gemma-3-1b-it for CPU inference on XNNPACK.model.pte: ExecuTorch programtokenizer.json, tokenizer.model, tokenizer_config.json, special_tokens_map.json, chat_template.jinja: tokenizer/chat artifactsconfig.json, generation_config.json: upstream model metadata1optimum-cli export executorch \
2 --model "google/gemma-3-1b-it" \
3 --task "text-generation" \
4 --recipe "xnnpack" \
5 --use_custom_sdpa \
6 --use_custom_kv_cache \
7 --qlinear "8da4w" \
8 --qembedding "8w" \
9 --max_seq_len 1024 \
10 --dtype "float32" \
11 --device "cpu" \
12 --output_dir "<output_dir>"--qlinear 8da4w: INT8 dynamic activations + INT4 weights for linear layers--qembedding 8w: INT8 weights for embeddings1.2.0a0+c7c7c0a (source commit: c7c7c0a442)0.2.0.dev0 (commit: 5bf1aeb587e9b1f3572b0bd60265c5dafd007b73)1cmake --workflow --preset llm-release
2cd examples/models/llama
3cmake --workflow --preset llama-release
4cd ../../1cmake-out/examples/models/llama/llama_main \
2 --model_path "model.pte" \
3 --tokenizer_path "tokenizer.json" \
4 --prompt "Once upon a time" \
5 --seq_len 128 \
6 --num_bos 11from optimum.executorch import ExecuTorchModelForCausalLM
2from transformers import AutoTokenizer
3
4model = ExecuTorchModelForCausalLM.from_pretrained(".")
5tokenizer = AutoTokenizer.from_pretrained(".")
6
7text = model.text_generation(
8 tokenizer=tokenizer,
9 prompt="Once upon a time",
10 max_seq_len=128,
11)
12print(text)google/gemma-3-1b-it