Views
No views yet
ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model,
a GRPO (Group Relative Policy Optimization) reinforcement-learning fine-tune, converted
with llama.cpp.| Field | Value |
|---|---|
| Source checkpoint | ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model |
| Base model | Qwen/Qwen3-0.6B |
| Training | GRPO (group-relative RL) on the chain_sum arithmetic-reasoning task |
| Dataset / environment | OpenEnv reasoning_gym — chain_sum (agentic env) |
| Quantization tool | llama.cpp convert_hf_to_gguf.py + llama-quantize |
| File | Size | Notes |
|---|---|---|
reasoning-gym-chain-sum-qwen3-0-6b-grpo-model.q4_k_m.gguf | 397 MB (recommended) | 4-bit K-quant medium; best size/quality balance |
reasoning-gym-chain-sum-qwen3-0-6b-grpo-model.q5_k_m.gguf | 444 MB (balanced) | 5-bit K-quant medium; near-full quality |
reasoning-gym-chain-sum-qwen3-0-6b-grpo-model.q8_0.gguf | 639 MB (largest) | 8-bit; closest to the source precision |
Q4_K_M. For maximum fidelity use Q8_0.1# One-shot
2llama-cli -hf ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF --jinja -p "Your prompt here" -n 256
3
4# Interactive chat
5llama-cli -hf ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF --jinja -cnvollama run hf.co/ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF:Q4_K_M1from llama_cpp import Llama
2
3llm = Llama.from_pretrained(
4 repo_id="ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF",
5 filename="*q4_k_m.gguf",
6 n_ctx=4096,
7)
8out = llm.create_chat_completion(
9 messages=[{"role": "user", "content": "Your prompt here"}],
10 max_tokens=256,
11)
12print(out["choices"][0]["message"]["content"])chain_sum arithmetic-reasoning task;
it is a reasoning demonstrator, not a general-purpose assistant. Verify outputs before
any downstream use.Q8_0 when fidelity matters.ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model).chain_sum arithmetic-reasoning task; capability on unrelated tasks is not guaranteed.1@misc{reasoning_gym_chain_sum_qwen3_0_6b_grpo_gguf,
2 author = {Ermia Azarkhalili},
3 title = {reasoning-gym-chain-sum-qwen3-0.6b-grpo — GGUF quantized},
4 year = {2026},
5 publisher = {Hugging Face},
6 howpublished = {\url{https://huggingface.co/ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF}}
7}