This is the canonical, fully merged version of a Qwen3-4B model fine-tuned on 17,944 high-quality Islamic Arabic question-answer pairs spanning Fiqh, Fatwa, Aqeedah, Quran Sciences, and Islamic Finance. The LoRA adapter has been merged into the base weights and saved in FP16; no additional adapter loading is required.
1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4model_id = "NightPrince/Qwen3-4B-Islamic-Arabic"
5
6tokenizer = AutoTokenizer.from_pretrained(model_id)
7model = AutoModelForCausalLM.from_pretrained(
8 model_id,
9 torch_dtype=torch.float16,
10 device_map="auto",
11)
12
13SYSTEM_PROMPT = (
14 "أنت مساعد عالم إسلامي متخصص. "
15 "أجب على الأسئلة بدقة استناداً إلى القرآن الكريم والسنة النبوية والفقه الإسلامي الكلاسيكي. "
16 "استشهد بالمصادر حيثما أمكن. كن موجزاً لكن شاملاً."
17)
18
19messages = [
20 {"role": "system", "content": SYSTEM_PROMPT},
21 {"role": "user", "content": "ما حكم الزكاة على المال المدخر؟"},
22]
23
24text = tokenizer.apply_chat_template(
25 messages,
26 tokenize=False,
27 add_generation_prompt=True,
28)
29inputs = tokenizer(text, return_tensors="pt").to(model.device)
30
31with torch.no_grad():
32 outputs = model.generate(
33 **inputs,
34 max_new_tokens=512,
35 temperature=0.7,
36 top_p=0.9,
37 do_sample=True,
38 )
39
40response = tokenizer.decode(outputs[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True)
41print(response)
The merged FP16 model is ~7.6 GB. Use at least tensor_parallel_size=2 on 11 GB GPUs (e.g., RTX 2080 Ti), or a single 24 GB+ GPU.
1# Install vLLM if needed
2pip install vllm
3
4# Serve with tensor parallelism across 2 GPUs
5vllm serve NightPrince/Qwen3-4B-Islamic-Arabic \
6 --dtype float16 \
7 --tensor-parallel-size 2 \
8 --max-model-len 4096 \
9 --port 8000
1from openai import OpenAI
2
3client = OpenAI(base_url="http://localhost:8000/v1", api_key="token-abc123")
4
5SYSTEM_PROMPT = (
6 "أنت مساعد عالم إسلامي متخصص. "
7 "أجب على الأسئلة بدقة استناداً إلى القرآن الكريم والسنة النبوية والفقه الإسلامي الكلاسيكي. "
8 "استشهد بالمصادر حيثما أمكن. كن موجزاً لكن شاملاً."
9)
10
11response = client.chat.completions.create(
12 model="NightPrince/Qwen3-4B-Islamic-Arabic",
13 messages=[
14 {"role": "system", "content": SYSTEM_PROMPT},
15 {"role": "user", "content": "ما حكم الزكاة على المال المدخر؟"},
16 ],
17 max_tokens=512,
18 temperature=0.7,
19)
20print(response.choices[0].message.content)
1@misc{alnwsany2026qwen3islamicarbic,
2 author = {Yahya Alnwsany},
3 title = {Qwen3-4B-Islamic-Arabic: QLoRA Fine-Tuning of Qwen3-4B on Islamic Arabic Q\&A},
4 year = {2026},
5 howpublished = {\url{https://huggingface.co/NightPrince/Qwen3-4B-Islamic-Arabic}},
6 note = {Base model: Qwen/Qwen3-4B. Dataset: NightPrince/islamic-arabic-qa.}
7}
This model is released under the
Apache 2.0 license, consistent with the base model
Qwen/Qwen3-4B. See
LICENSE for details.