Views
No views yet
| Variant | File | Size | Description |
|---|---|---|---|
| Q4_K_M | qwen3-reranker-0.6b-q4-k-m.gguf | 378 MB | 4-bit quantization (recommended) |
pip install qwen3-embed[gguf]1from qwen3_embed import TextCrossEncoder
2
3reranker = TextCrossEncoder("n24q02m/Qwen3-Reranker-0.6B-GGUF")
4scores = list(reranker.rerank("What is AI?", ["AI is...", "Pizza is..."]))1from llama_cpp import Llama
2
3model = Llama(
4 model_path="qwen3-reranker-0.6b-q4-k-m.gguf",
5 n_ctx=40960,
6 logits_all=False,
7)
8# Use chat template for scoring (see qwen3-embed source for details)convert_hf_to_gguf.py (F16) + llama-quantize (Q4_K_M)