Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3# Load model and tokenizer
4model = AutoModelForCausalLM.from_pretrained("deployable_model")
5tokenizer = AutoTokenizer.from_pretrained("deployable_model")
6
7# Format your prompt correctly
8prompt = "<|you|>\nWhat is Italy's capital and why is it historically important?\n<|my response|>\n"
9
10# Generate
11inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
12outputs = model.generate(
13 inputs.input_ids,
14 max_new_tokens=200,
15 temperature=0.7,
16 top_p=0.9,
17 do_sample=True
18)
19
20# Decode and process the response
21generated_text = tokenizer.decode(outputs[0], skip_special_tokens=False)
22response = generated_text.split("<|my response|>")[1].split("<|you|>")[0].strip()
23print(response)1import requests
2
3API_URL = "https://api-inference.huggingface.co/models/YOUR_USERNAME/deployable_model"
4headers = {"Authorization": "Bearer YOUR_HF_TOKEN"}
5
6def query(payload):
7 response = requests.post(API_URL, headers=headers, json=payload)
8 return response.json()
9
10output = query({
11 "inputs": "<|you|>\nWhat is Italy's capital and why is it historically important?\n<|my response|>\n",
12 "parameters": {"max_new_tokens": 200, "temperature": 0.7, "top_p": 0.9}
13})<|you|>
User message here
<|my response|><|my identity|>
System prompt here
<|you|>
User message here
<|my response|>