Views
No views yet
ema1{
2 "attention_probs_dropout_prob": 0.1,
3 "hidden_dropout_prob": 0.1,
4 "hidden_size": 384,
5 "intermediate_size": 1280,
6 "max_position_embeddings": 512,
7 "position_bucket_size": 32,
8 "num_attention_heads": 6,
9 "num_hidden_layers": 12,
10 "vocab_size": 8192,
11 "layer_norm_eps": 1e-05,
12 "force_causal_mask": true,
13 "classifier_dropout": 0.1,
14 "classifier_layer_norm_eps": 1e-05,
15 "num_labels": 2
16}tokenizer_ces_vs8192.json1from transformers import AutoTokenizer, AutoModelForMaskedLM
2model_id = 'jumelet/gptbert-ces-100steps-small'
3tok = AutoTokenizer.from_pretrained(model_id)
4model = AutoModelForMaskedLM.from_pretrained(model_id, trust_remote_code=True)
5out = model(**tok('Hello world', return_tensors='pt'))GPTBertForSequenceClassification mirrors the original GLUE classifier head for downstream fine-tuning.1from transformers import AutoTokenizer, AutoModelForSequenceClassification
2model_id = 'jumelet/gptbert-ces-100steps-small'
3tok = AutoTokenizer.from_pretrained(model_id)
4model = AutoModelForSequenceClassification.from_pretrained(model_id, trust_remote_code=True)
5outputs = model(**tok('This movie was great!', return_tensors='pt'))
6print(outputs.logits)trust_remote_code=True due to custom architecture.