Views
No views yet
| Hyperparameter | Value |
|---|---|
| Training regime | BF16 mixed precision |
| Optimizer | AdamW with cosine learning rate scheduler |
| LoRA Configuration | rank=8, alpha=32, dropout=0.1 |
| Batch Size | 48 |
| Learning Rate | 1e-5 |
| Sequence Length | 14K tokens |
| Fine-tuning Epochs | 1 |
| Compute Environment | DeepSpeed for memory-efficient distributed training |
| Compute Infrastructure | 8x H100 |