Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4model_name = "iduryodhanrao/my-quantized-llm"
5
6tokenizer = AutoTokenizer.from_pretrained(model_name)
7model = AutoModelForCausalLM.from_pretrained(
8 model_name,
9 device_map="auto",
10 trust_remote_code=True
11)
12
13prompt = "Hello, how are you?"
14inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
15outputs = model.generate(**inputs, max_new_tokens=50)
16print(tokenizer.decode(outputs[0], skip_special_tokens=True))1import requests
2
3API_URL = "https://api-inference.huggingface.co/models/iduryodhanrao/my-quantized-llm"
4headers = {"Authorization": "Bearer YOUR_HF_TOKEN"}
5
6def query(payload):
7 response = requests.post(API_URL, headers=headers, json=payload)
8 return response.json()
9
10output = query({"inputs": "The future of AI is"})
11print(output)