Views
No views yet
AutoModel:1from transformers import AutoModelForMaskedLM
2model = AutoModelForMaskedLM.from_pretrained("jonsaadfalcon/M2-BERT-128-Retrieval-Encoder-V1", trust_remote_code=True)bert-base-uncased tokenizer:from transformers import BertTokenizer
tokenizer = BertTokenizer.from_pretrained('bert-base-uncased')from transformers import AutoTokenizer, AutoModelForMaskedLM
max_seq_length = 128
testing_string = "Every morning, I make a cup of coffee to start my day."
model = AutoModelForMaskedLM.from_pretrained("jonsaadfalcon/M2-BERT-128-Retrieval-Encoder-V1", trust_remote_code=True)
tokenizer = AutoTokenizer.from_pretrained("bert-base-uncased", model_max_length=max_seq_length)
input_ids = tokenizer([testing_string], return_tensors="pt", padding="max_length", return_token_type_ids=False, truncation=True, max_length=max_seq_length)
outputs = model(**input_ids)
embeddings = outputs['sentence_embedding']trust_remote_code=True to be passed to the from_pretrained method. This is because we use custom PyTorch code (see our GitHub). You should consider passing a revision argument that specifies the exact git commit of the code, for example:1mlm = AutoModelForMaskedLM.from_pretrained(
2 "jonsaadfalcon/M2-BERT-128-Retrieval-Encoder-V1",
3 trust_remote_code=True,
4)use_flash_mm is false by default. Using FlashMM is currently not supported.