Views
No views yet
main1{
2 "attention_probs_dropout_prob": 0.1,
3 "hidden_dropout_prob": 0.1,
4 "hidden_size": 768,
5 "intermediate_size": 2560,
6 "max_position_embeddings": 512,
7 "position_bucket_size": 32,
8 "num_attention_heads": 12,
9 "num_hidden_layers": 12,
10 "vocab_size": 16384,
11 "layer_norm_eps": 1e-05
12}tokenizer_eng.json1from transformers import AutoTokenizer, AutoModelForMaskedLM
2model_id = 'haznitrama/babybabellm-multi_gpu-gpt_bert-eng-main-causal'
3tok = AutoTokenizer.from_pretrained(model_id)
4model = AutoModelForMaskedLM.from_pretrained(model_id, trust_remote_code=True)
5out = model(**tok('Hello world', return_tensors='pt'))1from transformers import AutoTokenizer, AutoModelForCausalLM
2mid='haznitrama/babybabellm-multi_gpu-gpt_bert-eng-main-causal'
3tok=AutoTokenizer.from_pretrained(mid)
4model=AutoModelForCausalLM.from_pretrained(mid, trust_remote_code=True)
5print(tok.decode(model.generate(**tok('Hello', return_tensors='pt'), max_new_tokens=20)[0], skip_special_tokens=True))trust_remote_code=True due to custom architecture.