Views
No views yet
1# Load model directly
2from transformers import AutoTokenizer, AutoModelForCausalLM
3
4tokenizer = AutoTokenizer.from_pretrained("AswanthCManoj/azma-deepseek-1.3b-instruct-v4-merged")
5model = AutoModelForCausalLM.from_pretrained(
6 "AswanthCManoj/azma-deepseek-1.3b-instruct-v4-merged",
7 low_cpu_mem_usage=True,
8 return_dict=True,
9 torch_dtype=torch.float16,
10 device_map={"": 0},
11)
12
13eval_prompt = """<|system|>
14Task: Given the a list of previous user queries, predict 3 future queries.
15
16Output Schema:
17{'properties': {'predicted_queries': {'description': 'The list of predicted queries', 'items': {'type': 'string'}, 'title': 'Predicted Queries', 'type': 'array'}}, 'required': ['predicted_queries'], 'title': 'ResponseModel', 'type': 'object'}<|end▁of▁sentence|><|user|>
18# Previous queries:
19---
20- Your core strength lies in understanding user intent and delivering clear, truthful, and empathetic responses.
21- Utilize the provided reference information to enhance your responses and ensure accuracy.
22- Always cross-reference the information for reliability, as references may vary in accuracy.
23---<|end▁of▁sentence|><|assistant|>"""
24
25model_input = tokenizer(eval_prompt, return_tensors="pt").to("cuda")
26
27merged_model.eval()
28with torch.no_grad():
29 stop_token_id = tokenizer.convert_tokens_to_ids("<|end▁of▁sentence|>")
30 gen_config = merged_model.generation_config
31 gen_config.temperature = 0.1
32 gen_config.max_length = 500
33 gen_config.stop_token_id = stop_token_id
34 output = merged_model.generate(**model_input, generation_config=gen_config)
35 decoded_output = [tokenizer.decode(token_id) for token_id in output]
36 print(decoded_output[0])
37
38# Output:
39# {"predicted_queries": ["How can I effectively communicate my core strength to users?", "What are some effective strategies for delivering accurate and truthful responses to users?", "How can I ensure accuracy and reliability of my responses to users?"]}