Views
No views yet
"Quality-filtered training data enables smaller, more efficient models with comparable performance."
1import torch
2from nanochat.gpt import GPT, GPTConfig
3from nanochat.tokenizer import get_tokenizer
4from nanochat.engine import Engine
5
6# Load model
7checkpoint = torch.load("pytorch_model.bin")
8config = GPTConfig(**{
9 "sequence_len": 512,
10 "vocab_size": 65536,
11 "n_layer": 10,
12 "n_head": 10,
13 "n_kv_head": 10,
14 "n_embd": 640
15})
16
17model = GPT(config)
18model.load_state_dict(checkpoint)
19model.eval()
20
21# Generate text
22tokenizer = get_tokenizer()
23engine = Engine(model, tokenizer)
24
25prompt_tokens = tokenizer("The capital of France is", prepend="<|bos|>")
26output, _ = engine.generate_batch(prompt_tokens, max_tokens=50, temperature=0.7)
27print(tokenizer.decode(output[0]))1@software{oren2025,
2 title={Oren: Quality Auditing for LLM Training Data},
3 author={Amir Valizadeh},
4 year={2025},
5 url={https://github.com/vitalune/Oren}
6}