Views
No views yet
Instruction: {{ instruction }} Query: {{ query }}Instruction: 为这个医学问题检索相关回答。Query: 咽喉癌的成因是什么?Instruction: Given a claim about climate change, retrieve documents that support or refute the claim. Query: However the warming trend is slower than most climate models have forecast.Query: {{ query }}transformers==4.37.21from transformers import AutoModel
2import torch
3
4model_name = "openbmb/MiniCPM-Embedding-Light"
5model = AutoModel.from_pretrained(model_name, trust_remote_code=True, torch_dtype=torch.float16).to("cuda")
6
7# you can use flash_attention_2 for faster inference
8# model = AutoModel.from_pretrained(model_name, trust_remote_code=True, attn_implementation="flash_attention_2", torch_dtype=torch.float16).to("cuda")
9
10model.eval()
11
12queries = ["MiniCPM-o 2.6 A GPT-4o Level MLLM for Vision, Speech and Multimodal Live Streaming on Your Phone"]
13passages = ["MiniCPM-o 2.6 is the latest and most capable model in the MiniCPM-o series. The model is built in an end-to-end fashion based on SigLip-400M, Whisper-medium-300M, ChatTTS-200M, and Qwen2.5-7B with a total of 8B parameters. It exhibits a significant performance improvement over MiniCPM-V 2.6, and introduces new features for real-time speech conversation and multimodal live streaming."]
14
15embeddings_query_dense, embeddings_query_sparse = model.encode_query(queries, return_sparse_vectors=True)
16embeddings_doc_dense, embeddings_doc_sparse = model.encode_corpus(passages, return_sparse_vectors=True)
17
18dense_scores = (embeddings_query_dense @ embeddings_doc_dense.T)
19print(dense_scores.tolist()) # [[0.6512398719787598]]
20print(model.compute_sparse_score_dicts(embeddings_query_sparse, embeddings_doc_sparse)) # [[0.27202296]]
21
22dense_scores, sparse_scores, mixed_scores = model.compute_score(queries, passages)
23print(dense_scores) # [[0.65123993]]
24print(sparse_scores) # [[0.27202296]]
25print(mixed_scores) # [[0.73284686]]1import torch
2from sentence_transformers import SentenceTransformer
3
4
5model_name = "openbmb/MiniCPM-Embedding-Light"
6model = SentenceTransformer(model_name, trust_remote_code=True, model_kwargs={"torch_dtype": torch.float16})
7
8# you can use flash_attention_2 for faster inference
9# model = SentenceTransformer(model_name, trust_remote_code=True, model_kwargs={"attn_implementation": "flash_attention_2", "torch_dtype": torch.float16})
10
11queries = ["中国的首都是哪里?"] # "What is the capital of China?"
12passages = ["beijing", "shanghai"] # "北京", "上海"
13
14INSTRUCTION = "Query: "
15
16embeddings_query = model.encode(queries, prompt=INSTRUCTION)
17embeddings_doc = model.encode(passages)
18
19scores = (embeddings_query @ embeddings_doc.T)
20print(scores.tolist()) # [[0.40356746315956116, 0.36183440685272217]]1import asyncio
2from infinity_emb import AsyncEngineArray, EngineArgs, AsyncEmbeddingEngine
3import numpy as np
4
5array = AsyncEngineArray.from_args([
6 EngineArgs(model_name_or_path = "openbmb/MiniCPM-Embedding-Light", engine="torch", dtype="float16", bettertransformer=False, pooling_method="mean", trust_remote_code=True),
7])
8queries = ["中国的首都是哪里?"] # "What is the capital of China?"
9passages = ["beijing", "shanghai"] # "北京", "上海"
10
11INSTRUCTION = "Query:"
12queries = [f"{INSTRUCTION} {query}" for query in queries]
13
14
15async def embed_text(engine: AsyncEmbeddingEngine,sentences):
16 async with engine:
17 embeddings, usage = await engine.embed(sentences=sentences)
18 return embeddings
19
20queries_embedding = asyncio.run(embed_text(array[0],queries))
21passages_embedding = asyncio.run(embed_text(array[0],passages))
22
23scores = (np.array(queries_embedding) @ np.array(passages_embedding).T)
24print(scores.tolist()) # [[0.40356746315956116, 0.36183443665504456]]1from FlagEmbedding import FlagModel
2
3
4model = FlagModel("openbmb/MiniCPM-Embedding-Light",
5 query_instruction_for_retrieval="Query: ",
6 pooling_method="mean",
7 trust_remote_code=True,
8 normalize_embeddings=True,
9 use_fp16=True)
10# You can hack the __init__() method of the FlagEmbedding BaseEmbedder class to use flash_attention_2 for faster inference
11# self.model = AutoModel.from_pretrained(
12# model_name_or_path,
13# trust_remote_code=trust_remote_code,
14# cache_dir=cache_dir,
15# # torch_dtype=torch.float16, # we need to add this line to use fp16
16# # attn_implementation="flash_attention_2", # we need to add this line to use flash_attention_2
17# )
18
19queries = ["中国的首都是哪里?"] # "What is the capital of China?"
20passages = ["beijing", "shanghai"] # "北京", "上海"
21
22
23embeddings_query = model.encode_queries(queries)
24embeddings_doc = model.encode_corpus(passages)
25
26scores = (embeddings_query @ embeddings_doc.T)
27print(scores.tolist()) # [[0.40356746315956116, 0.36183440685272217]]| 模型 Model | C-MTEB/Retrieval(NDCG@10) | BEIR(NDCG@10) |
|---|---|---|
| bge-large-zh-v1.5 | 70.46 | - |
| gte-large-zh | 72.49 | - |
| Conan-embedding-v1 | 76.67 | |
| bge-large-en-v1.5 | - | 54.29 |
| modernbert-embed-large | - | 54.36 |
| snowflake-arctic-embed-l | - | 55.98 |
| gte-en-large-v1.5 | - | 57.91 |
| me5-large | 63.66 | 51.43 |
| bge-m3(Dense) | 65.43 | 48.82 |
| gte-multilingual-base(Dense) | 71.95 | 51.08 |
| jina-embeddings-v3 | 68.60 | 53.88 |
| gte-Qwen2-1.5B-instruct | 71.86 | 58.29 |
| MiniCPM-Embedding | 76.76 | 58.56 |
| MiniCPM-Embedding-Light(Dense) | 72.71 | 55.27 |
| MiniCPM-Embedding-Light(Dense+Sparse) | 73.13 | 56.31 |
| MiniCPM-Embedding-Light(Dense+Sparse)+MiniCPM-Reranker-Light | 76.34 | 61.49 |
| 模型 Model | MKQA En-Zh_CN (Recall@20) | NeuCLIR22 (NDCG@10) | NeuCLIR23 (NDCG@10) |
|---|---|---|---|
| me5-large | 44.3 | 9.01 | 25.33 |
| bge-m3(Dense) | 66.4 | 30.49 | 41.09 |
| gte-multilingual-base(Dense) | 68.2 | 39.46 | 45.86 |
| MiniCPM-Embedding | 72.95 | 52.65 | 49.95 |
| MiniCPM-Embedding-Light(Dense) | 68.29 | 41.17 | 45.83 |
| MiniCPM-Embedding-Light(Dense)+MiniCPM-Reranker-Light | 71.86 | 54.32 | 56.50 |