Views
No views yet
| Metric | Value |
|---|---|
| Global Step | 80,000 / 256,137 |
| Epoch | 0.312 (31.2%) |
| Samples Processed | 2,560,000 / 8,139,164 |
| Loss | 0.73 |
| Accuracy | 78.4% |
| Language | Samples Seen | Total | Progress |
|---|---|---|---|
| German (de) | ~640,000 | 2,018,145 | 31.7% |
| Spanish (es) | ~640,000 | 2,050,976 | 31.2% |
| French (fr) | ~640,000 | 2,045,181 | 31.3% |
| Italian (it) | ~640,000 | 2,024,862 | 31.6% |
1model = "swiss-ai/Apertus-8B-Instruct-2509"
2per_device_train_batch_size = 1
3gradient_accumulation_steps = 4
4learning_rate = 2e-6
5num_train_epochs = 1
6warmup_ratio = 0.03
7lr_scheduler_type = "linear"
8bf16 = True
9gradient_checkpointing = Truecheckpoint-80000/
├── pytorch_model_fsdp_0/ # FSDP sharded model weights
├── optimizer_0/ # Optimizer states
├── rng_state_[0-7].pth # RNG states for 8 GPUs
├── scheduler.pt # LR scheduler state
└── trainer_state.json # Step, epoch, metrics1from transformers import Trainer
2
3trainer = Trainer(
4 model=model,
5 args=training_args,
6 train_dataset=dataset,
7)
8
9# Resume from checkpoint
10trainer.train(resume_from_checkpoint="./checkpoint-80000")input_ids, labels, attention_mask