Views
No views yet
pip install -U sentence-transformers1from sentence_transformers import SentenceTransformer
2sentences = ["This is an example sentence", "Each sentence is converted"]
3
4model = SentenceTransformer("louisbrulenaudet/tsdae-lemone-mbert-base")
5embeddings = model.encode(sentences)
6print(embeddings)1from transformers import AutoTokenizer, AutoModel
2import torch
3
4
5def cls_pooling(model_output, attention_mask):
6 return model_output[0][:,0]
7
8
9# Sentences we want sentence embeddings for
10sentences = ['This is an example sentence', 'Each sentence is converted']
11
12# Load model from HuggingFace Hub
13tokenizer = AutoTokenizer.from_pretrained("louisbrulenaudet/tsdae-lemone-mbert-base")
14model = AutoModel.from_pretrained("louisbrulenaudet/tsdae-lemone-mbert-base")
15
16# Tokenize sentences
17encoded_input = tokenizer(sentences, padding=True, truncation=True, return_tensors="pt")
18
19# Compute token embeddings
20with torch.no_grad():
21 model_output = model(**encoded_input)
22
23# Perform pooling. In this case, cls pooling.
24sentence_embeddings = cls_pooling(model_output, encoded_input["attention_mask"])
25
26print("Sentence embeddings:")
27print(sentence_embeddings)torch.utils.data.dataloader.DataLoader of length 25000 with parameters:{'batch_size': 4, 'sampler': 'torch.utils.data.sampler.RandomSampler', 'batch_sampler': 'torch.utils.data.sampler.BatchSampler'}sentence_transformers.losses.DenoisingAutoEncoderLoss.DenoisingAutoEncoderLoss{
"epochs": 1,
"evaluation_steps": 0,
"max_grad_norm": 1,
"optimizer_class": "<class 'torch.optim.adamw.AdamW'>",
"optimizer_params": {
"lr": 3e-05
},
"scheduler": "constantlr",
"steps_per_epoch": null,
"warmup_steps": 10000,
"weight_decay": 0
}DenoisingAutoEncoderDataset is crafted to provide pairs of noisy and clean data instances. This arrangement allows the denoising autoencoder model to learn and enhance its ability to reconstruct or generate clean data from the corrupted versions provided in the dataset.SentenceTransformer(
(0): Transformer({'max_seq_length': 512, 'do_lower_case': False}) with Transformer model: BertModel
(1): Pooling({'word_embedding_dimension': 768, 'pooling_mode_cls_token': True, 'pooling_mode_mean_tokens': False, 'pooling_mode_max_tokens': False, 'pooling_mode_mean_sqrt_len_tokens': False})
)1@misc{louisbrulenaudet2023,
2 author = {Louis Brulé Naudet},
3 title = {Domain-adapted mBERT for French Legal Practice},
4 year = {2023}
5 howpublished = {\url{https://huggingface.co/louisbrulenaudet/tsdae-lemone-mbert-base}},
6}