Views
No views yet
davidnichols-ops/claude-yolo-vibes-v4-mlx-4bit (quantized) or davidnichols-ops/claude-yolo-vibes-v4-dpo (full BF16).| Parameter | Value |
|---|---|
| Base model | Qwen2.5-Coder-7B-Instruct |
| Training data | 1,031 verified agent sessions |
| Epochs | 3 |
| Learning rate | 2e-5 |
| Batch size | 4 (with gradient accumulation) |
| Hardware | AMD MI300X (ROCm) |
| Training time | ~45 min |
| Final loss | 0.56 |
| Token accuracy | 91.2% |
| Stage | Pass@1 |
|---|---|
| Base | 88.4% |
| SFT (this model) | 88.4% |
| DPO (final) | 88.4% |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("davidnichols-ops/claude-yolo-vibes-v4-sft", torch_dtype="auto", device_map="auto")
4tokenizer = AutoTokenizer.from_pretrained("davidnichols-ops/claude-yolo-vibes-v4-sft")
5
6messages = [
7 {"role": "system", "content": "You are a helpful coding assistant."},
8 {"role": "user", "content": "Write a Python function to reverse a linked list"},
9]
10text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
11inputs = tokenizer(text, return_tensors="pt").to(model.device)
12outputs = model.generate(**inputs, max_new_tokens=512)
13print(tokenizer.decode(outputs[0], skip_special_tokens=True))