This repository contains a nanochat checkpoint exported for Hugging Face. The
architecture mirrors GPT-style decoders with rotary embeddings, RMSNorm, multi-query
attention, relu² MLPs, and untied embeddings.
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("yasuiniko/nanochat-d8-base-39000", trust_remote_code=True)
4tokenizer = AutoTokenizer.from_pretrained("yasuiniko/nanochat-d8-base-39000", trust_remote_code=True)
5
6inputs = tokenizer("Hello nanochat!", return_tensors="pt")
7output_ids = model.generate(**inputs, max_length=128)
8print(tokenizer.decode(output_ids[0], skip_special_tokens=True))