Views
No views yet
1from transformers import AutoProcessor, AutoModelForCausalLM
2
3MODEL_ID = "FlameF0X/gemma-4-E2B-it-pruned"
4
5# Load model
6processor = AutoProcessor.from_pretrained(MODEL_ID)
7model = AutoModelForCausalLM.from_pretrained(
8 MODEL_ID,
9 dtype="auto",
10 device_map="auto"
11)
12# Prompt
13messages = [
14 {"role": "system", "content": "You are a helpful assistant."},
15 {"role": "user", "content": "Write a short joke about saving RAM."},
16]
17
18# Process input
19text = processor.apply_chat_template(
20 messages,
21 tokenize=False,
22 add_generation_prompt=True,
23 enable_thinking=False
24)
25inputs = processor(text=text, return_tensors="pt").to(model.device)
26input_len = inputs["input_ids"].shape[-1]
27
28# Generate output
29outputs = model.generate(**inputs, max_new_tokens=1024)
30response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
31
32# Parse output
33processor.parse_response(response)
34