基于
Qwen/Qwen3-4B,通过激活消融(Activation Ablation)技术移除拒绝行为的编辑版本。
本模型是使用
LLM-Refusal-Remover 工具对 Qwen3-4B 进行"脑手术"后的产物。通过识别模型内部的"拒绝方向"(refusal direction),利用正交投影从指定 Transformer 层的 MLP
down_proj 权重中剔除该方向,从而改变模型对敏感输入的响应模式。
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_id = "R41NH4RD/Qwen3-4B-Refusal-Removed"
4
5tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
6model = AutoModelForCausalLM.from_pretrained(
7 model_id,
8 torch_dtype="auto",
9 trust_remote_code=True,
10 device_map="auto"
11)
12model.eval()
13
14messages = [{"role": "user", "content": "你的问题"}]
15prompt = tokenizer.apply_chat_template(
16 messages,
17 tokenize=False,
18 add_generation_prompt=True,
19 enable_thinking=False,
20)
21inputs = tokenizer([prompt], return_tensors="pt").to(model.device)
22
23with torch.inference_mode():
24 output = model.generate(
25 **inputs,
26 max_new_tokens=512,
27 do_sample=True,
28 temperature=0.7,
29 top_p=0.8,
30 pad_token_id=tokenizer.eos_token_id,
31 )
32
33response = tokenizer.decode(output[0, inputs["input_ids"].shape[1]:], skip_special_tokens=True)
34print(response)
本模型采用
MIT License 开源许可。基础模型 Qwen3-4B 遵循其原始许可证。