Knowledge Continuity Regularized Network
Dataset: ANLI
Round: None
Trainer Hyperparameters:
lr = 5e-05
per_device_batch_size = 32
gradient_accumulation_steps = 1
weight_decay = 1e-09
seed = 42
Regularization Hyperparameters
numerical stability denominator constant = 0.01
lambda = 0.01
alpha = 2.0
beta = 2.0
Extended Logs:
| eval_loss | eval_accuracy | epoch |
|---|
| 35.454 | 0.377 | 1.0 |
| 35.145 | 0.430 | 2.0 |
| 36.412 | 0.398 | 3.0 |
| 36.059 | 0.412 | 4.0 |
| 35.343 | 0.439 | 5.0 |
| 36.344 | 0.404 | 6.0 |
| 35.642 | 0.429 | 7.0 |
| 35.901 | 0.423 | 8.0 |
| 35.521 | 0.440 | 9.0 |
| 36.187 | 0.410 | 10.0 |
| 35.229 | 0.443 | 11.0 |
| 35.957 | 0.418 | 12.0 |
| 36.329 | 0.413 | 13.0 |
| 35.825 | 0.427 | 14.0 |
| 35.952 | 0.424 | 15.0 |
| 36.270 | 0.416 | 16.0 |
| 35.488 | 0.441 | 17.0 |
| 35.927 | 0.428 | 18.0 |
| 35.777 | 0.434 | 19.0 |
| 36.308 | 0.414 | 20.0 |
| 35.802 | 0.431 | 21.0 |
| 35.942 | 0.425 | 22.0 |
| 35.742 | 0.432 | 23.0 |
| 35.739 | 0.430 | 24.0 |
| 35.817 | 0.430 | 25.0 |
| 35.718 | 0.434 | 26.0 |
| 35.822 | 0.428 | 27.0 |
| 35.512 | 0.441 | 28.0 |
| 35.449 | 0.443 | 29.0 |
| 35.409 | 0.444 | 30.0 |
| 35.029 | 0.455 | 31.0 |
| 35.306 | 0.445 | 32.0 |
| 35.708 | 0.435 | 33.0 |
| 35.472 | 0.442 | 34.0 |
| 35.284 | 0.448 | 35.0 |
| 35.237 | 0.448 | 36.0 |
| 35.477 | 0.442 | 37.0 |
| 35.172 | 0.450 | 38.0 |
| 35.018 | 0.455 | 39.0 |
| 35.533 | 0.440 | 40.0 |
| 35.097 | 0.452 | 41.0 |
| 35.664 | 0.436 | 42.0 |
| 35.173 | 0.450 | 43.0 |
| 34.991 | 0.459 | 44.0 |
| 35.091 | 0.454 | 45.0 |
| 35.070 | 0.454 | 46.0 |
| 34.998 | 0.455 | 47.0 |
| 35.143 | 0.451 | 48.0 |
| 34.888 | 0.461 | 49.0 |
Test Accuracy: 0.456