Views
No views yet
1import torch
2import argparse
3from transformers import pipeline
4
5def main():
6 parser = argparse.ArgumentParser(description="Minimal Llama Inference")
7 # This is the "model_id argument" you asked for
8 parser.add_argument(
9 "model_id",
10 nargs="?",
11 default="uisikdag/umitllama-mini-english",
12 help="Hugging Face model ID or local path"
13 )
14 args = parser.parse_args()
15
16 print(f"Loading model from HF: {args.model_id}")
17
18 # Create pipeline
19 generator = pipeline(
20 "text-generation",
21 model=args.model_id,
22 torch_dtype=torch.float16 if torch.cuda.is_available() else torch.float32,
23 device_map="auto",
24 trust_remote_code=True
25 )
26
27 # Generate
28 prompt = "The economy is:"
29 print(f"\nPrompt: {prompt}")
30
31 output = generator(
32 prompt,
33 max_new_tokens=50,
34 do_sample=True,
35 temperature=0.7,
36 pad_token_id=generator.tokenizer.eos_token_id
37 )
38
39 print(f"\nResponse:\n{output[0]['generated_text']}")
40
41if __name__ == "__main__":
42 main()