Knowledge Continuity Regularized Network
Dataset: ANLI
Round: None
Trainer Hyperparameters:
lr = 1e-05
per_device_batch_size = 64
gradient_accumulation_steps = 1
weight_decay = 0.0
seed = 42
Regularization Hyperparameters
numerical stability denominator constant = 0.01
lambda = 0.001
alpha = 2.0
beta = 2.0
Extended Logs:
| eval_loss | eval_accuracy | epoch |
|---|
| 35.369 | 0.413 | 1.0 |
| 36.104 | 0.391 | 2.0 |
| 36.027 | 0.398 | 3.0 |
| 36.128 | 0.400 | 4.0 |
| 36.149 | 0.395 | 5.0 |
| 36.231 | 0.392 | 6.0 |
| 35.865 | 0.411 | 7.0 |
| 35.711 | 0.422 | 8.0 |
| 35.913 | 0.415 | 9.0 |
| 35.810 | 0.412 | 10.0 |
| 35.908 | 0.411 | 11.0 |
| 35.887 | 0.413 | 12.0 |
| 35.980 | 0.407 | 13.0 |
| 35.761 | 0.416 | 14.0 |
Test Accuracy: 0.413