Views
No views yet
| Calibration set | qasper (with 100 random samples)" |
| Quantization tool | Optimum-Intel |
| Backend | IPEX |
| Original model | BAAI/BGE-large-en-v1.5 |
INT8 | FP32 | % diff | |
|---|---|---|---|
| Reranking | 0.5997 | 0.6003 | -0.108% |
| Retrieval | 0.5346 | 0.5429 | -1.53% |
pip install -U optimum[neural-compressor, ipex] intel-extension-for-transformers1from optimum.intel import IPEXModel
2
3model = IPEXModel.from_pretrained("Intel/bge-large-en-v1.5-rag-int8-static")1from transformers import AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("Intel/bge-large-en-v1.5-rag-int8-static")
4
5inputs = tokenizer(sentences, return_tensors='pt')
6
7with torch.no_grad():
8 outputs = model(**inputs)
9 # get the vector of [CLS]
10 embedded = model_output[0][:, 0]1from fastrag.rankers import QuantizedBiEncoderRanker
2
3ranker = QuantizedBiEncoderRanker("Intel/bge-large-en-v1.5-rag-int8-static")1
2from haystack import Pipeline
3
4p = Pipeline()
5p.add_node(component=retriever, name="retriever", inputs=["Query"])
6p.add_node(component=ranker, name="ranker", inputs=["retriever"])