Views
No views yet
1from sentence_transformers import SentenceTransformer
2model = SentenceTransformer("dangvantuan/sentence-camembert-large")
3
4sentences = ["Un avion est en train de décoller.",
5 "Un homme joue d'une grande flûte.",
6 "Un homme étale du fromage râpé sur une pizza.",
7 "Une personne jette un chat au plafond.",
8 "Une personne est en train de plier un morceau de papier.",
9 ]
10
11embeddings = model.encode(sentences)1from sentence_transformers import SentenceTransformer
2from sentence_transformers.readers import InputExample
3from datasets import load_dataset
4def convert_dataset(dataset):
5 dataset_samples=[]
6 for df in dataset:
7 score = float(df['similarity_score'])/5.0 # Normalize score to range 0 ... 1
8 inp_example = InputExample(texts=[df['sentence1'],
9 df['sentence2']], label=score)
10 dataset_samples.append(inp_example)
11 return dataset_samples
12
13# Loading the dataset for evaluation
14df_dev = load_dataset("stsb_multi_mt", name="fr", split="dev")
15df_test = load_dataset("stsb_multi_mt", name="fr", split="test")
16
17# Convert the dataset for evaluation
18
19# For Dev set:
20dev_samples = convert_dataset(df_dev)
21val_evaluator = EmbeddingSimilarityEvaluator.from_input_examples(dev_samples, name='sts-dev')
22val_evaluator(model, output_path="./")
23
24# For Test set:
25test_samples = convert_dataset(df_test)
26test_evaluator = EmbeddingSimilarityEvaluator.from_input_examples(test_samples, name='sts-test')
27test_evaluator(model, output_path="./")| Model | Pearson correlation | Spearman correlation | #params |
|---|---|---|---|
| dangvantuan/sentence-camembert-large | 88.2 | 88.02 | 336M |
| dangvantuan/sentence-camembert-base | 86.73 | 86.54 | 110M |
| distiluse-base-multilingual-cased | 79.22 | 79.16 | 135M |
| GPT-3 (text-davinci-003) | 85 | NaN | 175B |
| GPT-(text-embedding-ada-002) | 79.75 | 80.44 | NaN |
| Model | Pearson correlation | Spearman correlation |
|---|---|---|
| dangvantuan/sentence-camembert-large | 85.9 | 85.8 |
| dangvantuan/sentence-camembert-base | 82.36 | 81.64 |
| distiluse-base-multilingual-cased | 78.62 | 77.48 |
| GPT-3 (text-davinci-003) | 82 | NaN |
| GPT-(text-embedding-ada-002) | 79.05 | 77.56 |
@article{reimers2019sentence,
title={Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks},
author={Nils Reimers, Iryna Gurevych},
journal={https://arxiv.org/abs/1908.10084},
year={2019}
}
@article{martin2020camembert,
title={CamemBERT: a Tasty French Language Mode},
author={Martin, Louis and Muller, Benjamin and Su{\'a}rez, Pedro Javier Ortiz and Dupont, Yoann and Romary, Laurent and de la Clergerie, {\'E}ric Villemonte and Seddah, Djam{\'e} and Sagot, Beno{\^\i}t},
journal={Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics},
year={2020}
}