Views
No views yet
jinaai/jina-embeddings-v5-omni-nano-retrieval for use with llama.cpp.Q4_K_M quant keeps the token_embd layer in F16 (--token-embedding-type f16).| File | Size | Notes |
|---|---|---|
jina-embeddings-v5-omni-nano-retrieval-Q4_K_M.gguf | ~261 MB | LLM weights, token_embd in F16 |
mmproj-jina-embeddings-v5-omni-nano-retrieval-F16.gguf | ~194 MB | Vision projector (required for image/video) |
feat-v5-omni branch), not upstream — upstream does not yet support this architecture:1git clone --depth 1 --branch feat-v5-omni https://github.com/jina-ai/llama.cpp
2cd llama.cpp && cmake -B build -DGGML_CUDA=ON && cmake --build build -j1./build/bin/llama-server \
2 -m jina-embeddings-v5-omni-nano-retrieval-Q4_K_M.gguf \
3 --mmproj mmproj-jina-embeddings-v5-omni-nano-retrieval-F16.gguf \
4 --embedding --pooling last \
5 -c 8192 -b 8192 -ub 8192 \
6 --host 127.0.0.1 --port 80801curl http://127.0.0.1:8080/props | jq -r .media_marker
2# e.g. <__media_yAbTtTRgL15vbFiVDhX20zar2jGO88oM__>1curl -s http://127.0.0.1:8080/embeddings \
2 -d '{"content":[{"prompt_string":"Query: Which planet is the Red Planet?"}]}'Query: prefix for queries and Document: prefix for documents (retrieval-targeted model)./props):1MARKER=$(curl -s http://127.0.0.1:8080/props | jq -r .media_marker)
2IMG_B64=$(base64 -w0 photo.jpg)
3curl -s http://127.0.0.1:8080/embeddings \
4 -d "{\"content\":[{\"prompt_string\":\"$MARKER\",\"multimodal_data\":[\"$IMG_B64\"]}]}"llama-embedding works:1./build/bin/llama-embedding \
2 -m jina-embeddings-v5-omni-nano-retrieval-Q4_K_M.gguf \
3 --pooling last --embd-normalize 2 \
4 -p "Query: a cute cat" --embd-output-format json| Threads | Latency |
|---|---|
| 1 | ~14.0 s |
| 2 | ~7.6 s |
| 4 | ~4.0 s |