Views
No views yet
Qwen/Qwen3.6-27B with reasoning-tuned weights.Lineage:Qwen/Qwen3.6-27B→ stage 1 LoRA (reasoning SFT) → merge → this checkpoint.
| Artifact | Repo |
|---|---|
| Stage-1 BF16 merged (this repo) | samscrack/Qwen3.6-27B-Opus-CoT-Stage1 |
| Stage-2 LoRA adapter (Hermes tool-calling, applies to this base) | samscrack/Qwen3.6-27B-Hermes-S2-LoRA |
| Stage-1 + Stage-2 merged + FP8 quantized (final release) | samscrack/Qwen3.6-27B-Opus-CoT-S1-Hermes-S2-SFT |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3tok = AutoTokenizer.from_pretrained("samscrack/Qwen3.6-27B-Opus-CoT-Stage1")
4model = AutoModelForCausalLM.from_pretrained(
5 "samscrack/Qwen3.6-27B-Opus-CoT-Stage1",
6 torch_dtype="auto",
7 device_map="auto",
8)
9msgs = [{"role": "user", "content": "Why does ice float on water?"}]
10inputs = tok.apply_chat_template(msgs, add_generation_prompt=True, return_tensors="pt").to(model.device)
11out = model.generate(inputs, max_new_tokens=512, temperature=0.7)
12print(tok.decode(out[0][inputs.shape[1]:], skip_special_tokens=True))1from peft import PeftModel
2base = AutoModelForCausalLM.from_pretrained(
3 "samscrack/Qwen3.6-27B-Opus-CoT-Stage1", torch_dtype="auto", device_map="auto"
4)
5model = PeftModel.from_pretrained(base, "samscrack/Qwen3.6-27B-Hermes-S2-LoRA")
6# Optional: merged = model.merge_and_unload()| Method | Supervised fine-tuning, LoRA via Unsloth + TRL SFTTrainer, then merge_and_unload to BF16 |
| Base | Qwen/Qwen3.6-27B (text-only causal LM; *ForConditionalGeneration rewritten to *ForCausalLM for SFT) |
| LoRA | r=64, α=64, dropout=0, targets: q_proj, k_proj, v_proj, o_proj, out_proj, gate_proj, up_proj, down_proj |
| Optimizer / LR | AdamW, 2e-4, cosine warmup, weight decay 0.01 |
| Schedule | 2 epochs, batch 4 × grad_accum 9 → effective batch 72, ctx 8192 |
| Steps / final loss | 346 / 0.250 |
| Wall clock | ~4 h on 2× RTX PRO 6000 Blackwell, DDP via torchrun --standalone --nproc-per-node=2 |
| Dataset | Rows | Provenance |
|---|---|---|
nohurry/Opus-4.6-Reasoning-3000x-filtered | 3,900 | Claude Opus 4.6 CoT distillations |
khazarai/qwen3.6-plus-high-reasoning-500x | 500 | Qwen 3.6 reasoning samples |
Roman1111111/claude-opus-4.6-10000x | 9,633 | Claude Opus 4.6 CoT distillations |
Qwen/Qwen3.6-27B — refusal patterns, knowledge cutoff, tokenizer biases.<tool_call>{...}</tool_call> outputs.Qwopus3-5-27b-Colab.ipynb), ported to a local dual-GPU setup with no other changes to the data pipeline.Qwen/Qwen3.6-27B. Dataset licenses apply to derived behavior — see each dataset card.