Views
No views yet
[!WARNING] 本模型面向 18 岁以上成年用户,可能输出包含成人内容、露骨描写等不适合所有受众的文本。请在使用前阅读下方免责声明。
| 项目 | 内容 |
|---|---|
| 基础模型 | Qwen/Qwen3-4B-Instruct-2507 |
| 数据类型 | bfloat16 |
| 上下文长度 | 原生支持 262,144(建议日常对话使用 4K–32K) |
| 对话模板 | ChatML(`< |
| 文件 | 说明 |
|---|---|
model-*.safetensors | 完整权重(bfloat16) |
config.json / tokenizer* / chat_template.jinja | 模型与分词器配置 |
generation_config.json | 推荐推理参数(请保持默认以获得最佳效果) |
infer.py | 开箱即用的命令行多轮对话脚本 |
Modelfile | Ollama 导入用的 Modelfile |
Qwen3-Sex-BF16.gguf | 未量化 GGUF(BF16,约 8 GB) |
Qwen3-Sex-Q8_0.gguf | Q8_0 量化 GGUF(约 4.3 GB) |
[!IMPORTANT]generation_config.json中的参数是经过调优后推荐使用的配置,强烈建议保持默认。
1{
2 "do_sample": true,
3 "temperature": 0.7,
4 "top_p": 0.8,
5 "repetition_penalty": 1.08,
6 "max_new_tokens": 2048,
7 "eos_token_id": [151645, 151643],
8 "pad_token_id": 151643,
9 "bos_token_id": 151643
10}infer.py(推荐)generation_config.json 中的参数推理,开箱即用:1# 安装依赖(建议使用 uv 创建虚拟环境)
2uv venv
3source .venv/bin/activate
4uv pip install torch transformers accelerate
5
6# 启动对话
7python infer.py[!TIP] 输入clear清空多轮对话历史,输入exit或quit退出。
1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer, GenerationConfig
3
4MODEL_NAME = "ystemsrx/Qwen3-Sex"
5
6tokenizer = AutoTokenizer.from_pretrained(MODEL_NAME, trust_remote_code=True)
7model = AutoModelForCausalLM.from_pretrained(
8 MODEL_NAME,
9 dtype=torch.bfloat16,
10 device_map="auto",
11 trust_remote_code=True,
12)
13model.eval()
14
15# 加载推荐推理配置(保持默认即可获得最佳效果)
16gen_config = GenerationConfig.from_pretrained(MODEL_NAME)
17
18messages = [
19 {"role": "user", "content": "你好,简单介绍一下你自己。"},
20]
21
22inputs = tokenizer.apply_chat_template(
23 messages,
24 add_generation_prompt=True,
25 return_tensors="pt",
26 return_dict=True,
27).to(model.device)
28
29with torch.inference_mode():
30 output_ids = model.generate(**inputs, generation_config=gen_config)
31
32response = tokenizer.decode(
33 output_ids[0][inputs["input_ids"].shape[-1]:],
34 skip_special_tokens=True,
35)
36print(response)Qwen3-Sex-BF16.gguf 和 Qwen3-Sex-Q8_0.gguf),可直接通过 Ollama 加载:1# 使用仓库内的 Modelfile 创建模型
2ollama create Qwen3-Sex -f Modelfile
3
4# 启动对话
5ollama run Qwen3-Sex[!CAUTION] GGUF 格式(尤其是 Q8_0 量化版)相比原始 safetensors 权重,推理质量会有所下降,部分细节、长上下文连贯性以及生成的稳定性可能不如直接使用infer.py。如果对生成质量有较高要求,请优先使用方式一或方式二。
[!CAUTION] 下载或使用本模型即表示您已阅读、理解并同意以下全部条款。如不同意,请立即停止下载和使用。