1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4model = AutoModelForCausalLM.from_pretrained(
5 "cmpatino/nanowhale-100m", trust_remote_code=True, dtype=torch.float32
6).cuda().eval()
7tokenizer = AutoTokenizer.from_pretrained("cmpatino/nanowhale-100m")
8
9messages = [{"role": "user", "content": "What are 3 benefits of exercise?"}]
10prompt = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
11input_ids = tokenizer.encode(prompt, return_tensors="pt").cuda()
12output = model.generate(input_ids, max_new_tokens=200, temperature=0.7, top_p=0.9,
13 pad_token_id=tokenizer.eos_token_id)
14print(tokenizer.decode(output[0][input_ids.shape[1]:], skip_special_tokens=True))
Trained on 1× NVIDIA H100 80GB.