210 题 = 60 open + 100 CMB mcq + 50 C-Eval mcq.
注: open 5 分制, M2-32B 当 judge 有天花板效应 (高分聚集), 真实差距需配合 mcq 客观题判读.
1pip install vllm>=0.19.1
2
3vllm serve shdkahjkda/medical-v5-8b \
4 --served-model-name medical-v5 \
5 --max-model-len 8192 \
6 --gpu-memory-utilization 0.85 \
7 --reasoning-parser qwen3 \
8 --dtype bfloat16
1from vllm import LLM, SamplingParams
2
3llm = LLM(model="shdkahjkda/medical-v5-8b", dtype="bfloat16")
4tokenizer = llm.get_tokenizer()
5
6messages = [
7 {"role": "user", "content": "风寒感冒和风热感冒怎么鉴别"}
8]
9prompt = tokenizer.apply_chat_template(
10 messages,
11 tokenize=False,
12 add_generation_prompt=True,
13 enable_thinking=True, # 关键: True 让模型先 thinking 再答
14)
15out = llm.generate([prompt], SamplingParams(temperature=0.3, max_tokens=4096))
16print(out[0].outputs[0].text)
1import openai
2client = openai.OpenAI(base_url="http://localhost:8000/v1", api_key="dummy")
3resp = client.chat.completions.create(
4 model="medical-v5",
5 messages=[{"role": "user", "content": "二陈汤的组成和功效"}],
6 temperature=0.3,
7 max_tokens=4096,
8 extra_body={"chat_template_kwargs": {"enable_thinking": True}},
9)
10# vllm 0.19.1: thinking 段在 resp.choices[0].message.reasoning, final 在 .content
包含: chat 推理接口 (FastAPI + vllm) / 训练 launcher / 评估脚本.
本模型仅供研究使用. 输出 不构成医疗建议, 任何临床决策必须由执业医师审核. 涉及具体用药、剂量、急救处理请始终咨询专业医务人员或拨打急救电话.
2026-06-21 完工. 后续视情况做 int4 量化部署到 RK3588 类边缘终端.
@misc{medical-v5-2026,
author = {pai-pixel},
title = {medical-v5: Qwen3-8B SFT 中医西医兼通临床助手},
year = {2026},
publisher = {HuggingFace},
howpublished = {\url{https://huggingface.co/shdkahjkda/medical-v5-8b}}
}