Views
No views yet
| Model | Inference-free for Retrieval | Model Parameters | AVG NDCG@10 | AVG FLOPS |
|---|---|---|---|---|
| opensearch-neural-sparse-encoding-v1 | 133M | 0.524 | 11.4 | |
| opensearch-neural-sparse-encoding-v2-distill | 67M | 0.528 | 8.3 | |
| opensearch-neural-sparse-encoding-doc-v1 | ✔️ | 133M | 0.490 | 2.3 |
| opensearch-neural-sparse-encoding-doc-v2-distill | ✔️ | 67M | 0.504 | 1.8 |
| opensearch-neural-sparse-encoding-doc-v2-mini | ✔️ | 23M | 0.497 | 1.7 |
| opensearch-neural-sparse-encoding-doc-v3-distill | ✔️ | 67M | 0.517 | 1.8 |
| opensearch-neural-sparse-encoding-doc-v3-gte | ✔️ | 133M | 0.546 | 1.7 |
pip install -U sentence-transformers1from sentence_transformers.sparse_encoder import SparseEncoder
2
3# Download from the 🤗 Hub
4model = SparseEncoder("opensearch-project/opensearch-neural-sparse-encoding-v2-distill")
5
6query = "What's the weather in ny now?"
7document = "Currently New York is rainy."
8
9query_embed = model.encode_query(query)
10document_embed = model.encode_document(document)
11
12sim = model.similarity(query_embed, document_embed)
13print(f"Similarity: {sim}")
14# Similarity: tensor([[38.6113]])
15
16decoded_query = model.decode(query_embed)
17decoded_document = model.decode(document_embed)
18
19for i in range(len(decoded_query)):
20 query_token, query_score = decoded_query[i]
21 doc_score = next((score for token, score in decoded_document if token == query_token), 0)
22 if doc_score != 0:
23 print(f"Token: {query_token}, Query score: {query_score:.4f}, Document score: {doc_score:.4f}")
24
25# Token: york, Query score: 2.7273, Document score: 2.9088
26# Token: now, Query score: 2.5734, Document score: 0.9208
27# Token: ny, Query score: 2.3895, Document score: 1.7237
28# Token: weather, Query score: 2.2184, Document score: 1.2368
29# Token: current, Query score: 1.8693, Document score: 1.4146
30# Token: today, Query score: 1.5888, Document score: 0.7450
31# Token: sunny, Query score: 1.4704, Document score: 0.9247
32# Token: nyc, Query score: 1.4374, Document score: 1.9737
33# Token: currently, Query score: 1.4347, Document score: 1.6019
34# Token: climate, Query score: 1.1605, Document score: 0.9794
35# Token: upstate, Query score: 1.0944, Document score: 0.7141
36# Token: forecast, Query score: 1.0471, Document score: 0.5519
37# Token: verve, Query score: 0.9268, Document score: 0.6692
38# Token: huh, Query score: 0.9126, Document score: 0.4486
39# Token: greene, Query score: 0.8960, Document score: 0.7706
40# Token: picturesque, Query score: 0.8779, Document score: 0.7120
41# Token: pleasantly, Query score: 0.8471, Document score: 0.4183
42# Token: windy, Query score: 0.8079, Document score: 0.2140
43# Token: favorable, Query score: 0.7537, Document score: 0.4925
44# Token: rain, Query score: 0.7519, Document score: 2.1456
45# Token: skies, Query score: 0.7277, Document score: 0.3818
46# Token: lena, Query score: 0.6995, Document score: 0.8593
47# Token: sunshine, Query score: 0.6895, Document score: 0.2410
48# Token: johnny, Query score: 0.6621, Document score: 0.3016
49# Token: skyline, Query score: 0.6604, Document score: 0.1933
50# Token: sasha, Query score: 0.6117, Document score: 0.2197
51# Token: vibe, Query score: 0.5962, Document score: 0.0414
52# Token: hardly, Query score: 0.5381, Document score: 0.7560
53# Token: prevailing, Query score: 0.4583, Document score: 0.4243
54# Token: unpredictable, Query score: 0.4539, Document score: 0.5073
55# Token: presently, Query score: 0.4350, Document score: 0.8463
56# Token: hail, Query score: 0.3674, Document score: 0.2496
57# Token: shivered, Query score: 0.3324, Document score: 0.5506
58# Token: wind, Query score: 0.3281, Document score: 0.1964
59# Token: rudy, Query score: 0.3052, Document score: 0.5785
60# Token: looming, Query score: 0.2797, Document score: 0.0357
61# Token: atmospheric, Query score: 0.2712, Document score: 0.0870
62# Token: vicky, Query score: 0.2471, Document score: 0.3490
63# Token: sandy, Query score: 0.2247, Document score: 0.2383
64# Token: crowded, Query score: 0.2154, Document score: 0.5737
65# Token: chilly, Query score: 0.1723, Document score: 0.1857
66# Token: blizzard, Query score: 0.1700, Document score: 0.4110
67# Token: ##cken, Query score: 0.1183, Document score: 0.0613
68# Token: unrest, Query score: 0.0923, Document score: 0.6363
69# Token: russ, Query score: 0.0624, Document score: 0.2127
70# Token: blackout, Query score: 0.0558, Document score: 0.5542
71# Token: kahn, Query score: 0.0549, Document score: 0.1589
72# Token: 2020, Query score: 0.0160, Document score: 0.0566
73# Token: nighttime, Query score: 0.0125, Document score: 0.37531import itertools
2import torch
3from transformers import AutoModelForMaskedLM, AutoTokenizer
4
5
6# get sparse vector from dense vectors with shape batch_size * seq_len * vocab_size
7def get_sparse_vector(feature, output):
8 values, _ = torch.max(output*feature["attention_mask"].unsqueeze(-1), dim=1)
9 values = torch.log(1 + torch.relu(values))
10 values[:,special_token_ids] = 0
11 return values
12
13# transform the sparse vector to a dict of (token, weight)
14def transform_sparse_vector_to_dict(sparse_vector):
15 sample_indices,token_indices=torch.nonzero(sparse_vector,as_tuple=True)
16 non_zero_values = sparse_vector[(sample_indices,token_indices)].tolist()
17 number_of_tokens_for_each_sample = torch.bincount(sample_indices).cpu().tolist()
18 tokens = [transform_sparse_vector_to_dict.id_to_token[_id] for _id in token_indices.tolist()]
19
20 output = []
21 end_idxs = list(itertools.accumulate([0]+number_of_tokens_for_each_sample))
22 for i in range(len(end_idxs)-1):
23 token_strings = tokens[end_idxs[i]:end_idxs[i+1]]
24 weights = non_zero_values[end_idxs[i]:end_idxs[i+1]]
25 output.append(dict(zip(token_strings, weights)))
26 return output
27
28
29# load the model
30model = AutoModelForMaskedLM.from_pretrained("opensearch-project/opensearch-neural-sparse-encoding-v2-distill")
31tokenizer = AutoTokenizer.from_pretrained("opensearch-project/opensearch-neural-sparse-encoding-v2-distill")
32
33# set the special tokens and id_to_token transform for post-process
34special_token_ids = [tokenizer.vocab[token] for token in tokenizer.special_tokens_map.values()]
35get_sparse_vector.special_token_ids = special_token_ids
36id_to_token = ["" for i in range(tokenizer.vocab_size)]
37for token, _id in tokenizer.vocab.items():
38 id_to_token[_id] = token
39transform_sparse_vector_to_dict.id_to_token = id_to_token
40
41
42
43query = "What's the weather in ny now?"
44document = "Currently New York is rainy."
45
46# encode the query & document
47feature = tokenizer([query, document], padding=True, truncation=True, return_tensors='pt')
48output = model(**feature)[0]
49sparse_vector = get_sparse_vector(feature, output)
50
51# get similarity score
52sim_score = torch.matmul(sparse_vector[0],sparse_vector[1])
53print(sim_score) # tensor(38.6112, grad_fn=<DotBackward0>)
54
55
56query_token_weight, document_query_token_weight = transform_sparse_vector_to_dict(sparse_vector)
57for token in sorted(query_token_weight, key=lambda x:query_token_weight[x], reverse=True):
58 if token in document_query_token_weight:
59 print("score in query: %.4f, score in document: %.4f, token: %s"%(query_token_weight[token],document_query_token_weight[token],token))
60
61
62
63# result:
64# score in query: 2.7273, score in document: 2.9088, token: york
65# score in query: 2.5734, score in document: 0.9208, token: now
66# score in query: 2.3895, score in document: 1.7237, token: ny
67# score in query: 2.2184, score in document: 1.2368, token: weather
68# score in query: 1.8693, score in document: 1.4146, token: current
69# score in query: 1.5887, score in document: 0.7450, token: today
70# score in query: 1.4704, score in document: 0.9247, token: sunny
71# score in query: 1.4374, score in document: 1.9737, token: nyc
72# score in query: 1.4347, score in document: 1.6019, token: currently
73# score in query: 1.1605, score in document: 0.9794, token: climate
74# score in query: 1.0944, score in document: 0.7141, token: upstate
75# score in query: 1.0471, score in document: 0.5519, token: forecast
76# score in query: 0.9268, score in document: 0.6692, token: verve
77# score in query: 0.9126, score in document: 0.4486, token: huh
78# score in query: 0.8960, score in document: 0.7706, token: greene
79# score in query: 0.8779, score in document: 0.7120, token: picturesque
80# score in query: 0.8471, score in document: 0.4183, token: pleasantly
81# score in query: 0.8079, score in document: 0.2140, token: windy
82# score in query: 0.7537, score in document: 0.4925, token: favorable
83# score in query: 0.7519, score in document: 2.1456, token: rain
84# score in query: 0.7277, score in document: 0.3818, token: skies
85# score in query: 0.6995, score in document: 0.8593, token: lena
86# score in query: 0.6895, score in document: 0.2410, token: sunshine
87# score in query: 0.6621, score in document: 0.3016, token: johnny
88# score in query: 0.6604, score in document: 0.1933, token: skyline
89# score in query: 0.6117, score in document: 0.2197, token: sasha
90# score in query: 0.5962, score in document: 0.0414, token: vibe
91# score in query: 0.5381, score in document: 0.7560, token: hardly
92# score in query: 0.4582, score in document: 0.4243, token: prevailing
93# score in query: 0.4539, score in document: 0.5073, token: unpredictable
94# score in query: 0.4350, score in document: 0.8463, token: presently
95# score in query: 0.3674, score in document: 0.2496, token: hail
96# score in query: 0.3324, score in document: 0.5506, token: shivered
97# score in query: 0.3281, score in document: 0.1964, token: wind
98# score in query: 0.3052, score in document: 0.5785, token: rudy
99# score in query: 0.2797, score in document: 0.0357, token: looming
100# score in query: 0.2712, score in document: 0.0870, token: atmospheric
101# score in query: 0.2471, score in document: 0.3490, token: vicky
102# score in query: 0.2247, score in document: 0.2383, token: sandy
103# score in query: 0.2154, score in document: 0.5737, token: crowded
104# score in query: 0.1723, score in document: 0.1857, token: chilly
105# score in query: 0.1700, score in document: 0.4110, token: blizzard
106# score in query: 0.1183, score in document: 0.0613, token: ##cken
107# score in query: 0.0923, score in document: 0.6363, token: unrest
108# score in query: 0.0624, score in document: 0.2127, token: russ
109# score in query: 0.0558, score in document: 0.5542, token: blackout
110# score in query: 0.0549, score in document: 0.1589, token: kahn
111# score in query: 0.0160, score in document: 0.0566, token: 2020
112# score in query: 0.0125, score in document: 0.3753, token: nighttime| Model | Average | Trec Covid | NFCorpus | NQ | HotpotQA | FiQA | ArguAna | Touche | DBPedia | SCIDOCS | FEVER | Climate FEVER | SciFact | Quora |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| opensearch-neural-sparse-encoding-v1 | 0.524 | 0.771 | 0.360 | 0.553 | 0.697 | 0.376 | 0.508 | 0.278 | 0.447 | 0.164 | 0.821 | 0.263 | 0.723 | 0.856 |
| opensearch-neural-sparse-encoding-v2-distill | 0.528 | 0.775 | 0.347 | 0.561 | 0.685 | 0.374 | 0.551 | 0.278 | 0.435 | 0.173 | 0.849 | 0.249 | 0.722 | 0.863 |
| opensearch-neural-sparse-encoding-doc-v1 | 0.490 | 0.707 | 0.352 | 0.521 | 0.677 | 0.344 | 0.461 | 0.294 | 0.412 | 0.154 | 0.743 | 0.202 | 0.716 | 0.788 |
| opensearch-neural-sparse-encoding-doc-v2-distill | 0.504 | 0.690 | 0.343 | 0.528 | 0.675 | 0.357 | 0.496 | 0.287 | 0.418 | 0.166 | 0.818 | 0.224 | 0.715 | 0.841 |
| opensearch-neural-sparse-encoding-doc-v2-mini | 0.497 | 0.709 | 0.336 | 0.510 | 0.666 | 0.338 | 0.480 | 0.285 | 0.407 | 0.164 | 0.812 | 0.216 | 0.699 | 0.837 |
| opensearch-neural-sparse-encoding-doc-v3-distill | 0.517 | 0.724 | 0.345 | 0.544 | 0.694 | 0.356 | 0.520 | 0.294 | 0.424 | 0.163 | 0.845 | 0.239 | 0.708 | 0.863 |
| opensearch-neural-sparse-encoding-doc-v3-gte | 0.546 | 0.734 | 0.360 | 0.582 | 0.716 | 0.407 | 0.520 | 0.389 | 0.455 | 0.167 | 0.860 | 0.312 | 0.725 | 0.873 |