This is a GPTQ 4-bit quantized version of
dnotitia/DNA-2.0-14B, optimized for efficient inference by
DLM (Data Science Lab., Ltd.).
GPTQ W4A16 quantization reduces model size by approximately 73% while maintaining near-original accuracy. Fully compatible with
vLLM for high-throughput production serving, and runnable on consumer-grade GPUs (16GB+).
1vllm serve dataslab/DLM-2.0-14B-GPTQ \
2 --dtype auto \
3 --max-model-len 32768 \
4 --enable-reasoning \
5 --reasoning-parser deepseek_r1
1vllm serve dataslab/DLM-2.0-14B-GPTQ \
2 --dtype auto \
3 --rope-scaling '{"rope_type":"yarn","factor":4.0,"original_max_position_embeddings":32768}' \
4 --max-model-len 131072 \
5 --enable-reasoning \
6 --reasoning-parser deepseek_r1
1from vllm import LLM, SamplingParams
2
3llm = LLM(model="dataslab/DLM-2.0-14B-GPTQ")
4sampling_params = SamplingParams(
5 temperature=0.6, top_p=0.95, top_k=20, max_tokens=4096
6)
7
8messages = [
9 {"role": "user", "content": "한국의 경제 발전 과정에 대해 설명해주세요."}
10]
11outputs = llm.chat(messages, sampling_params=sampling_params)
12print(outputs[0].outputs[0].text)
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("dataslab/DLM-2.0-14B-GPTQ")
4model = AutoModelForCausalLM.from_pretrained(
5 "dataslab/DLM-2.0-14B-GPTQ",
6 device_map="auto",
7)
8
9messages = [
10 {"role": "user", "content": "복잡한 윤리적 딜레마에 대해 다각도로 분석해줘."}
11]
12inputs = tokenizer.apply_chat_template(
13 messages, add_generation_prompt=True, return_dict=True, return_tensors="pt"
14).to(model.device)
15
16outputs = model.generate(
17 **inputs,
18 max_new_tokens=4096,
19 temperature=0.6,
20 top_p=0.95,
21 top_k=20,
22 do_sample=True,
23)
24print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True))
For more details, see the
arXiv paper (2507.05686).
Apache 2.0 — Same as the base model.