Views
No views yet
| Data | size(train) | size(valid) | size(test) |
|---|---|---|---|
| ATEC | 62477 | 20000 | 20000 |
| BQ | 100000 | 10000 | 10000 |
| LCQMC | 238766 | 8802 | 12500 |
| PAWSX | 49401 | 2000 | 2000 |
| STS-B | 5231 | 1458 | 1361 |
| SNLI | 146828 | 2699 | 2618 |
| MNLI | 122547 | 2932 | 2397 |
| Model | STS-B(w-avg) | ATEC | BQ | LCQMC | PAWSX | Avg. |
|---|---|---|---|---|---|---|
| BAAI/bge-large-zh | 78.61 | - | - | - | - | - |
| BAAI/bge-large-zh-v1.5 | 79.07 | - | - | - | - | - |
| hellonlp/simcse-large-zh | 81.32 | - | - | - | - | - |
| hellonlp/promcse-large-zh | 81.63 | - | - | - | - | - |
promcse package from PyPIpip install promcse1from promcse import PromCSE
2model = PromCSE("hellonlp/promcse-bert-large-zh", "cls", 10)1embeddings = model.encode("武汉是一个美丽的城市。")
2print(embeddings.shape)
3#torch.Size([1024])1sentences_a = ['你好吗']
2sentences_b = ['你怎么样','我吃了一个苹果','你过的好吗','你还好吗','你',
3 '你好不好','你好不好呢','我不开心','我好开心啊', '你吃饭了吗',
4 '你好吗','你现在好吗','你好个鬼']
5similarities = model.similarity(sentences_a, sentences_b)
6print(similarities)
7# [(1.0, '你好吗'),
8# (0.9324, '你好不好'),
9# (0.8945, '你好不好呢'),
10# (0.8845, '你还好吗'),
11# (0.8382, '你现在好吗'),
12# (0.8072, '你过的好吗'),
13# (0.7648, '你怎么样'),
14# (0.6736, '你'),
15# (0.5706, '你吃饭了吗'),
16# (0.5417, '你好个鬼'),
17# (0.3747, '我好开心啊'),
18# (0.0777, '我不开心'),
19# (0.0624, '我吃了一个苹果')]