Views
No views yet

epochs: Number of training epochs (default: 4)block_size: Maximum sequence length (default: 1024)batch_size: Training batch size (default: 16)embeddings_dims: Model embedding dimensions (default: 512)no_of_heads: Number of attention heads (default: 8)no_of_decoder_layers: Number of decoder layers (default: 8)attn_dropout: Attention dropout rate (default: 0.1)dropout: General dropout rate (default: 0.1)experts: Number of MoE experts (default: 8)top_experts: Number of experts to route to (default: 2)noisy_topk: Use noisy top-k routing (default: False)max_lr: Maximum learning rate (default: 6e-4)weight_decay_optim: Weight decay for optimizer (default: 0.01)beta_1: Beta1 for optimizer (default: 0.9)beta_2: Beta2 for optimizer (default: 0.95)eps: Epsilon for optimizer (default: 1e-8)clip: Gradient clipping value (default: 1.0)device: Device to use (default: 'cuda:0')use_checkpointing: Use gradient checkpointing (default: False)use_liger: Use Liger kernels for optimization (default: True)use_flash_attention: Use Flash Attention (default: True)use_compile: Use torch.compile (default: True)vocab_size: Vocabulary size (default: based on tokenizer + 768)val_epochs: Validation frequency (default: 2)