Views
No views yet
Qwen/Qwen2.5-1.5B (base variant).
The adapter was trained via domain adaptation on an AI Safety / Deepfake Misinformation corpus, then merged
into the base weights using merge_and_unload() for standalone deployment (no separate adapter needed at inference time).Qwen/Qwen2.5-1.5Bpeft.PeftModel.merge_and_unload()transformers==4.46.3, trl==0.12.2, peft==0.13.21from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig
2import torch
3
4bnb_config = BitsAndBytesConfig(
5 load_in_4bit=True,
6 bnb_4bit_quant_type="nf4",
7 bnb_4bit_compute_dtype=torch.float16,
8 bnb_4bit_use_double_quant=True,
9)
10
11model = AutoModelForCausalLM.from_pretrained(
12 "nooruiit-864/qwen2.5-1.5b-base-ai-safety-domain-lora",
13 quantization_config=bnb_config,
14 device_map="auto",
15)
16tokenizer = AutoTokenizer.from_pretrained("nooruiit-864/qwen2.5-1.5b-base-ai-safety-domain-lora")| Model Variant | Weights Size | Avg Latency (s) | Tokens/sec | Peak GPU Memory (GB) |
|---|---|---|---|---|
| Base model (FP16, no adapter) | ~2960 MB | 2.479 | 24.2 | 3.103 |
| Unmerged LoRA (base + adapter, FP16) | ~2960 MB + adapter | 3.733 | 9.64 | 3.176 |
| Merged + Quantized (4-bit NF4) | 2959.6 MB → 1099.1 MB | 2.419 | 14.88 | 1.164 |
do_sample=False, batch size 1; results may vary on other hardware/settings.