Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_name = "Ellbendls/llama-3.2-3b-chat-doctor"
4tokenizer = AutoTokenizer.from_pretrained(model_name)
5model = AutoModelForCausalLM.from_pretrained(model_name)
6
7# Example usage
8input_text = "I had a surgery which ended up with some failures. What can I do to fix it?"
9
10# Prepare inputs with explicit padding and attention mask
11inputs = tokenizer(input_text, return_tensors="pt", padding=True, truncation=True)
12
13# Generate response with more explicit parameters
14outputs = model.generate(
15 input_ids=inputs['input_ids'],
16 attention_mask=inputs['attention_mask'],
17 max_new_tokens=150, # Specify max new tokens to generate
18 do_sample=True, # Enable sampling for more diverse responses
19 temperature=0.7, # Control randomness of output
20 top_p=0.9, # Nucleus sampling to maintain quality
21 num_return_sequences=1 # Number of generated sequences
22)
23
24# Decode the generated response
25response = tokenizer.decode(outputs[0], skip_special_tokens=True)
26
27print(response)