Views
No views yet
1from transformers import AutoTokenizer, pipeline
2import torch
3
4model = "Rhaps360/gemma-dep-ins-ft"
5
6tokenizer = AutoTokenizer.from_pretrained(model)
7pipeline = pipeline(
8 "text-generation",
9 model=model,
10 model_kwargs={"torch_dtype": torch.bfloat16},
11 device="cuda" if(torch.cuda.is_available()) else "cpu",
12 )
13
14messages = [
15 {"role": "user", "content": "### Context: the input message goes here. ### Response: "}
16]
17prompt = pipeline.tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
18outputs = pipeline(
19 prompt,
20 max_new_tokens=300,
21 do_sample=True,
22 temperature=0.2,
23 top_k=50,
24 top_p=0.95
25)
26print(outputs[0]["generated_text"][len(prompt):])