Views
No views yet
Qwen/Qwen3-0.6B, trained with a 2-stage recipe:Qwen/Qwen3-0.6Blora_adapter/* (adapter weights)merged_safetensors/* (merged full model)merged_gguf/model-f16.ggufSalesforce/xlam-function-calling-60knvidia/When2CallRoman1111111/claude-opus-4.6-10000xCrownelius/Opus-4.6-Reasoning-3300xr=64, alpha=128, dropout=0.05, target_modules=all-linear1638432162e-4 (cosine, warmup ratio 0.05)0.126719 (checkpoint-8500)r=32, alpha=64, dropout=0.05, target_modules=all-linearbeta=0.1, loss_type=sigmoidmax_length=1024, max_prompt_length=5121325e-7 (cosine, warmup ratio 0.03)precompute_ref_log_probs=true, precompute_ref_batch_size=1NVIDIA GeForce RTX 5090 (31.37 GiB)12.82.11.0+cu1281.0.00.18.15.5.12026-04-12 (UTC)1python eval/eval_fc.py \
2 --model_path ./outputs/final_weights/merged_safetensors \
3 --eval_type all \
4 --device cuda3/4 (75%)3/4 (75%)67/100 (67%)1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3model_id = "diverWayne/Qwen3-0.6B-ToolCalling-Claude-4.6-Opus-Distilled-v1"
4
5tokenizer = AutoTokenizer.from_pretrained(model_id, subfolder="merged_safetensors", trust_remote_code=True)
6model = AutoModelForCausalLM.from_pretrained(model_id, subfolder="merged_safetensors", trust_remote_code=True)1from transformers import AutoModelForCausalLM
2from peft import PeftModel
3
4base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-0.6B", trust_remote_code=True)
5model = PeftModel.from_pretrained(base, "diverWayne/Qwen3-0.6B-ToolCalling-Claude-4.6-Opus-Distilled-v1", subfolder="lora_adapter")Apache-2.0.