Views
No views yet
1import torch
2from transformers import AutoTokenizer, AutoModelForCausalLM
3
4model_id = "S-teven/tinygoop-1.1b"
5
6tokenizer = AutoTokenizer.from_pretrained(model_id)
7model = AutoModelForCausalLM.from_pretrained(
8 model_id,
9 torch_dtype=torch.float16,
10 device_map="auto"
11)
12
13prompt = "hey"
14inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
15
16outputs = model.generate(
17 **inputs,
18 max_new_tokens=256,
19 do_sample=True,
20 temperature=1.2,
21 top_p=0.95,
22 repetition_penalty=1.05
23)
24
25print(tokenizer.decode(outputs[0], skip_special_tokens=True))| Precision | VRAM Required | Hardware |
|---|---|---|
| 4-bit Quantized | ~800MB | Any modern GPU |
| CPU (FP32) | ~4GB RAM | Modern CPU (slow) |