Views
No views yet
1from transformers import AutoModel, AutoTokenizer
2
3model = AutoModel.from_pretrained("OpenMatch/cocodr-base-msmarco")
4tokenizer = AutoTokenizer.from_pretrained("OpenMatch/cocodr-base-msmarco") 1
2sentences = [
3 "Where was Marie Curie born?",
4 "Maria Sklodowska, later known as Marie Curie, was born on November 7, 1867.",
5 "Born in Paris on 15 May 1859, Pierre Curie was the son of Eugène Curie, a doctor of French Catholic origin from Alsace."
6]
7
8inputs = tokenizer(sentences, padding=True, truncation=True, return_tensors="pt")
9embeddings = model(**inputs, output_hidden_states=True, return_dict=True).hidden_states[-1][:, :1].squeeze(1) # the embedding of the [CLS] token after the final layer1
2score01 = embeddings[0] @ embeddings[1] # 216.9792
3score02 = embeddings[0] @ embeddings[2] # 216.6684