Views
No views yet
| Metric | Original | Trimmed | Reduction |
|---|---|---|---|
| Vocabulary size | 100,352 tokens | 32,768 tokens | 67.35% |
| Model size | 352,379,904 params | 283,173,888 params | 19.64% |

1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4device = "cuda"
5model_path = "alphaedge-ai/granite-4.0-350m-ces-32768"
6
7tokenizer = AutoTokenizer.from_pretrained(model_path)
8# drop device_map if running on CPU
9model = AutoModelForCausalLM.from_pretrained(model_path, device_map=device)
10model.eval()
11
12# change input text as desired
13chat = [
14 {"role": "user", "content": "Your prompt in Czech."},
15]
16chat = tokenizer.apply_chat_template(chat, tokenize=False, add_generation_prompt=True)
17
18# tokenize the text
19input_tokens = tokenizer(chat, return_tensors="pt").to(device)
20
21# generate output tokens
22output = model.generate(**input_tokens, max_new_tokens=100)
23
24# decode output tokens into text
25output = tokenizer.batch_decode(output)
26print(output[0])@misc{granite2025,
author = {IBM Research},
title = {Granite 4.0 Language Models},
year = {2025},
howpublished = {https://github.com/ibm-granite/granite-4.0-language-models},
}@misc{hf_blogpost_trimming,
title={Introduction to Trimming},
author={Loïck BOURDOIS and Tom AARSEN and Bram VANROY and Christopher AKIKI and Woojun JUNG and Manuel ROMERO and Prithiv SAKTHI},
year={2026},
url={https://huggingface.co/blog/lbourdois/introduction-to-trimming},
}