Views
No views yet

*ForMaskedLM model and the discriminator could be
any *ForTokenClassification model. Therefore, we can extend the task to ALBERT models,
not just BERT as in the original paper.1from transformers import AlbertForSequenceClassification, BertTokenizer
2
3# Both models use the bert-base-uncased tokenizer and vocab.
4tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')
5alectra = AlbertForSequenceClassification.from_pretrained('shoarora/alectra-small-owt')batch_size: 512training_steps: 5e5warmup_steps: 4e4learning_rate: 2e-3| Model | # Params | CoLA | SST | MRPC | STS | QQP | MNLI | QNLI | RTE |
|---|---|---|---|---|---|---|---|---|---|
| ELECTRA-Small++ | 14M | 57.0 | 91. | 88.0 | 87.5 | 89.0 | 81.3 | 88.4 | 66.7 |
| ELECTRA-Small-OWT | 14M | 56.8 | 88.3 | 87.4 | 86.8 | 88.3 | 78.9 | 87.9 | 68.5 |
| ELECTRA-Small-OWT (ours) | 17M | 56.3 | 88.4 | 75.0 | 86.1 | 89.1 | 77.9 | 83.0 | 67.1 |
| ALECTRA-Small-OWT (ours) | 4M | 50.6 | 89.1 | 86.3 | 87.2 | 89.1 | 78.2 | 85.9 | 69.6 |
| Model | # Params | CoLA | SST | MRPC | STS | QQP | MNLI | QNLI | RTE |
|---|---|---|---|---|---|---|---|---|---|
| BERT-Base | 110M | 52.1 | 93.5 | 84.8 | 85.9 | 89.2 | 84.6 | 90.5 | 66.4 |
| GPT | 117M | 45.4 | 91.3 | 75.7 | 80.0 | 88.5 | 82.1 | 88.1 | 56.0 |
| ELECTRA-Small++ | 14M | 57.0 | 91.2 | 88.0 | 87.5 | 89.0 | 81.3 | 88.4 | 66.7 |
| ELECTRA-Small-OWT (ours) | 17M | 57.4 | 89.3 | 76.2 | 81.9 | 87.5 | 78.1 | 82.4 | 68.1 |
| ALECTRA-Small-OWT (ours) | 4M | 43.9 | 87.9 | 82.1 | 82.0 | 87.6 | 77.9 | 85.8 | 67.5 |