unsloth/Qwen2.5-3B-bnb-4bit| Quant | File | Size (MB) |
|---|---|---|
| Q4_K_M | merged-fp16.Q4_K_M.gguf | 1929.9 |
model-*.safetensors etc. — merged FP16 weights (vLLM / transformers)| Metric | Value |
|---|---|
| Final training loss | 0.8085754909515381 |
| End chosen reward | -0.872550094127655 |
| End rejected reward | -0.9477240920066834 |
| End reward gap | 0.07517399787902834 |
1from llama_cpp import Llama
2llm = Llama(model_path="lab22-dpo-Q4_K_M.gguf", n_ctx=512, n_gpu_layers=-1)
3out = llm.create_chat_completion(
4 messages=[{"role": "user", "content": "Giải thích quicksort 3 câu."}],
5 max_tokens=200, temperature=0.0,
6)
7print(out["choices"][0]["message"]["content"])vllm serve Wan1302/lab22-dpo-adapter-gguf --port 8000 --max-model-len 512