Views
No views yet
1# Use a pipeline as a high-level helper
2from transformers import pipeline
3import re
4
5pipe = pipeline("text-generation", model="towardsinnovationlab/qwen3-medical")
6
7messages = [
8 {"role": "user", "content": "What are the main symptoms of heart disease? Please provide your answer in bullet points."},
9]
10result = pipe(messages)
11# Extract only the assistant's response
12assistant_response = result[0]['generated_text'][-1]['content']
13# Remove the <think> tags and their content
14clean_response = re.sub(r'<think>.*?</think>', '', assistant_response, flags=re.DOTALL).strip()
15print(clean_response)1# Load model directly
2from transformers import AutoTokenizer, AutoModelForCausalLM
3import re
4
5tokenizer = AutoTokenizer.from_pretrained("towardsinnovationlab/qwen3-medical")
6model = AutoModelForCausalLM.from_pretrained("towardsinnovationlab/qwen3-medical")
7messages = [
8 {"role": "user", "content": "What are the main symptoms of heart disease? Please provide your answer in bullet points."},
9]
10
11inputs = tokenizer.apply_chat_template(
12 messages,
13 add_generation_prompt=True,
14 tokenize=True,
15 return_dict=True,
16 return_tensors="pt",
17).to(model.device)
18
19outputs = model.generate(
20 **inputs,
21 max_new_tokens=512,
22 temperature=0.7,
23 top_p=0.8,
24 top_k=20,
25 do_sample=True
26)
27
28# Extract assistant's response
29assistant_response = tokenizer.decode(
30 outputs[0][inputs["input_ids"].shape[-1]:],
31 skip_special_tokens=True
32)
33
34# Remove <think> tags and their content
35clean_response = re.sub(r'<think>.*?</think>', '', assistant_response, flags=re.DOTALL).strip()
36
37print(clean_response)