Views
No views yet
Can a microscopic model (40M params), when saturated with a large amount of data (14B tokens), generate minimally coherent narrative text?
Llama-style architecture with tweaks for small-scale efficiency).| Benchmark | Metric | Result |
|---|---|---|
| WikiText-2 | Perplexity (PPL) | 54.21 |
trust_remote_code=True.1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4model_id = "Madras1/MTLM2-40M"
5
6model = AutoModelForCausalLM.from_pretrained(model_id, trust_remote_code=True)
7tokenizer = AutoTokenizer.from_pretrained("mistralai/Mistral-7B-v0.1")
8
9prompt = "The future of AI is"
10inputs = tokenizer(prompt, return_tensors="pt")
11
12output = model.generate(**inputs, max_new_tokens=50, do_sample=True, temperature=0.7)
13print(tokenizer.decode(output[0]))