zen-nano-0.6b-f16.gguf - Full precision (1.19 GB)zen-nano-0.6b-Q8_0.gguf - 8-bit quantization (604 MB)zen-nano-0.6b-Q5_K_M.gguf - 5-bit quantization (418 MB)zen-nano-0.6b-Q4_K_M.gguf - 4-bit quantization (373 MB)1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("zenlm/zen-nano")
4tokenizer = AutoTokenizer.from_pretrained("zenlm/zen-nano")
5
6prompt = "Who are you?"
7inputs = tokenizer(prompt, return_tensors="pt")
8outputs = model.generate(**inputs, max_length=100)
9response = tokenizer.decode(outputs[0], skip_special_tokens=True)
10print(response)1# Download a GGUF file
2wget https://huggingface.co/zenlm/zen-nano/resolve/main/gguf/zen-nano-0.6b-Q4_K_M.gguf
3
4# Run with llama.cpp
5./llama-cli -m zen-nano-0.6b-Q4_K_M.gguf -p "Who are you?" -n 100I'm Zen Nano, a 0.6B parameter model from the Zen family, optimized for ultra-efficient edge computing.
1@model{zen-nano-2025,
2 title={Zen Nano: Ultra-efficient Edge Computing Model},
3 author={Zen AI Team},
4 year={2025},
5 publisher={HuggingFace},
6 url={https://huggingface.co/zenlm/zen-nano}
7}