Views
No views yet
1import torch
2import argparse
3from transformers import AutoModelForCausalLM, AutoTokenizer
4
5def run_inference(model_id, prompt, max_tokens=50):
6 print(f"Fetching model '{model_id}' from Hugging Face Hub...")
7
8 # Load tokenizer and model
9 tokenizer = AutoTokenizer.from_pretrained(model_id)
10 model = AutoModelForCausalLM.from_pretrained(
11 model_id,
12 torch_dtype=torch.float16,
13 device_map="auto"
14 )
15
16 print(f"\nPrompt: {prompt}")
17 inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
18
19 # Llama models do not use token_type_ids
20 inputs.pop("token_type_ids", None)
21
22 # Generate
23 print("Generating...")
24 with torch.no_grad():
25 outputs = model.generate(
26 **inputs,
27 max_new_tokens=max_tokens,
28 do_sample=True,
29 temperature=0.7,
30 pad_token_id=tokenizer.eos_token_id
31 )
32
33 result = tokenizer.decode(outputs[0], skip_special_tokens=True)
34 print(f"\nResponse:\n{result}")
35
36if __name__ == "__main__":
37 parser = argparse.ArgumentParser()
38 parser.add_argument("--model_id", type=str, default="uisikdag/umitllama04b-galore-english")
39 parser.add_argument("--prompt", type=str, default="The future of artificial intelligence is")
40 args = parser.parse_args()
41
42 run_inference(args.model_id, args.prompt)