Views
No views yet
1from transformers import AutoProcessor, AutoModelForCausalLM
2
3processor = AutoProcessor.from_pretrained("LyJonathan/gemma-4-e2b-claude-distilled")
4model = AutoModelForCausalLM.from_pretrained("LyJonathan/gemma-4-e2b-claude-distilled", device_map="cuda", dtype=torch.float16)
5
6messages = [
7 {"role": "system", "content": "You are a helpful assistant."},
8 {"role": "user", "content": "Write a short joke about saving RAM."},
9]
10
11text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
12inputs = processor(text=text, return_tensors="pt").to(model.device)
13outputs = model.generate(**inputs, max_new_tokens=256)
14print(processor.decode(outputs[0], skip_special_tokens=True))