1{
2 "do_sample": true,
3 "temperature": 0.7,
4 "top_p": 0.8,
5 "repetition_penalty": 1.08,
6 "max_new_tokens": 2048,
7 "eos_token_id": [151645, 151643],
8 "pad_token_id": 151643,
9 "bos_token_id": 151643
10}
1# 安装依赖(建议使用 uv 创建虚拟环境)
2uv venv
3source .venv/bin/activate
4uv pip install torch transformers accelerate
5
6# 启动对话
7python infer.py
1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer, GenerationConfig
3
4MODEL_NAME = "ystemsrx/Qwen3-Sex"
5
6tokenizer = AutoTokenizer.from_pretrained(MODEL_NAME, trust_remote_code=True)
7model = AutoModelForCausalLM.from_pretrained(
8 MODEL_NAME,
9 dtype=torch.bfloat16,
10 device_map="auto",
11 trust_remote_code=True,
12)
13model.eval()
14
15# 加载推荐推理配置(保持默认即可获得最佳效果)
16gen_config = GenerationConfig.from_pretrained(MODEL_NAME)
17
18messages = [
19 {"role": "user", "content": "你好,简单介绍一下你自己。"},
20]
21
22inputs = tokenizer.apply_chat_template(
23 messages,
24 add_generation_prompt=True,
25 return_tensors="pt",
26 return_dict=True,
27).to(model.device)
28
29with torch.inference_mode():
30 output_ids = model.generate(**inputs, generation_config=gen_config)
31
32response = tokenizer.decode(
33 output_ids[0][inputs["input_ids"].shape[-1]:],
34 skip_special_tokens=True,
35)
36print(response)
1# 使用仓库内的 Modelfile 创建模型
2ollama create Qwen3-Sex -f Modelfile
3
4# 启动对话
5ollama run Qwen3-Sex
本模型遵循
Apache License 2.0 协议,并继承基础模型 Qwen/Qwen3-4B-Instruct-2507 的相关许可条款。