Knowledge Continuity Regularized Network
Dataset: ANLI
Round: None
Trainer Hyperparameters:
lr = 5e-05
per_device_batch_size = 16
gradient_accumulation_steps = 1
weight_decay = 1e-09
seed = 42
Regularization Hyperparameters
numerical stability denominator constant = 1.0
lambda = 1.0
alpha = 1.0
beta = 1.0
Extended Logs:
| eval_loss | eval_accuracy | epoch |
|---|
| 1.096 | 0.427 | 1.0 |
| 1.090 | 0.432 | 2.0 |
| 1.077 | 0.455 | 3.0 |
| 1.087 | 0.443 | 4.0 |
| 1.082 | 0.453 | 5.0 |
| 1.085 | 0.444 | 6.0 |
| 1.082 | 0.448 | 7.0 |
| 1.084 | 0.446 | 8.0 |
| 1.088 | 0.448 | 9.0 |
| 1.091 | 0.444 | 10.0 |
| 1.089 | 0.455 | 11.0 |
| 1.084 | 0.461 | 12.0 |
| 1.082 | 0.458 | 13.0 |
| 1.080 | 0.461 | 14.0 |
| 1.080 | 0.461 | 15.0 |
| 1.081 | 0.454 | 16.0 |
| 1.078 | 0.463 | 17.0 |
| 1.078 | 0.461 | 18.0 |
| 1.076 | 0.469 | 19.0 |
Test Accuracy: 0.463