Views
No views yet
| Data | size(train) | size(valid) | size(test) |
|---|---|---|---|
| ATEC | 62477 | 20000 | 20000 |
| BQ | 100000 | 10000 | 10000 |
| LCQMC | 238766 | 8802 | 12500 |
| PAWSX | 49401 | 2000 | 2000 |
| STS-B | 5231 | 1458 | 1361 |
| SNLI | 146828 | 2699 | 2618 |
| MNLI | 122547 | 2932 | 2397 |
| Model | STS-B(w-avg) | ATEC | BQ | LCQMC | PAWSX | Avg. |
|---|---|---|---|---|---|---|
| BERT-Whitening | 65.27 | - | - | - | - | - |
| SimBERT | 70.01 | - | - | - | - | - |
| SBERT-Whitening | 71.75 | - | - | - | - | - |
| BAAI/bge-base-zh | 78.61 | - | - | - | - | - |
| hellonlp/simcse-base-zh | 80.96 | - | - | - | - | - |
| hellonlp/promcse-base-zh | 81.57 | - | - | - | - | - |
promcse package from PyPIpip install promcse1from promcse import PromCSE
2model = PromCSE("hellonlp/promcse-bert-base-zh", "cls", 10)1embeddings = model.encode("武汉是一个美丽的城市。")
2print(embeddings.shape)
3#torch.Size([768])1sentences_a = ['你好吗']
2sentences_b = ['你怎么样','我吃了一个苹果','你过的好吗','你还好吗','你',
3 '你好不好','你好不好呢','我不开心','我好开心啊', '你吃饭了吗',
4 '你好吗','你现在好吗','你好个鬼']
5similarities = model.similarity(sentences_a, sentences_b)
6print(similarities)
7# [(1.0, '你好吗'),
8# (0.9167, '你好不好'),
9# (0.8956, '你好不好呢'),
10# (0.8431, '你还好吗'),
11# (0.7919, '你怎么样'),
12# (0.7649, '你现在好吗'),
13# (0.7458, '你过的好吗'),
14# (0.6844, '你好个鬼'),
15# (0.6177, '你'),
16# (0.5654, '你吃饭了吗'),
17# (0.3612, '我好开心啊'),
18# (0.1875, '我不开心'),
19# (0.0866, '我吃了一个苹果')]