Views
No views yet
per_device_train_batch_size: 1gradient_accumulation_steps: 4warmup_steps: 2max_steps: 300learning_rate: 2e-4fp16: Trueweight_decay: 1e-3logging_steps: 1output_dir: "outputs"optim: "paged_adamw_8bit"r: 8target_modules: ["q_proj", "o_proj", "k_proj", "v_proj", "gate_proj", "up_proj", "down_proj"]task_type: "CAUSAL_LM"