Views
No views yet
Quantized by tex8 — a platform building AI-native web solutions and cloud services.
| File | Quant | Size | Description |
|---|---|---|---|
Octen-Embedding-8B-Q4_K_M.gguf | Q4_K_M | 4.0 GB | Good balance of size and quality |
Octen-Embedding-8B-Q6_K.gguf | Q6_K | 6.5 GB | High quality, moderate size |
Octen-Embedding-8B-Q8_0.gguf | Q8_0 | 8.0 GB | Near-lossless, recommended |
--leave-output-tensor and --token-embedding-type F16 to preserve embedding quality.1llama-embedding \
2 -m Octen-Embedding-8B-Q8_0.gguf \
3 --pooling last \
4 -p "Your text here"1from llama_cpp import Llama
2
3llm = Llama(
4 model_path="Octen-Embedding-8B-Q8_0.gguf",
5 embedding=True,
6 n_gpu_layers=-1,
7 n_ctx=2048,
8)
9
10result = llm.create_embedding("Your text here")
11embedding = result['data'][0]['embedding'] # 4096-dim vector1# Step 1: Convert to F16
2python convert_hf_to_gguf.py Octen/Octen-Embedding-8B \
3 --outfile Octen-Embedding-8B-f16.gguf \
4 --outtype f16
5
6# Step 2: Quantize
7llama-quantize \
8 --leave-output-tensor \
9 --token-embedding-type F16 \
10 Octen-Embedding-8B-f16.gguf \
11 Octen-Embedding-8B-Q8_0.gguf Q8_0