Views
No views yet
optimum library.| Attribute | Detail |
|---|---|
| Base Model | Qwen/Qwen3-Embedding-0.6B |
| Format | ONNX (Opset 17) |
| Quantization | INT8 (AVX2 optimized) |
| Task | Feature Extraction / Semantic Embedding |
| File Size | ~0.6 GB (vs ~1.2 GB Original) |
auto-truncate is required because the model supports 32k context, but Docker defaults to smaller batches.1docker run --rm -p 8080:80 \\
2 -v $PWD/data:/data \\
3 ghcr.io/huggingface/text-embeddings-inference:cpu-latest \\
4 --model-id Svenni551/Qwen3-Embedding-0.6B-ONNX-INT8 \\
5 --pooling mean \\
6 --auto-truncate1services:
2 embedding-service:
3 image: ghcr.io/huggingface/text-embeddings-inference:cpu-latest
4 environment:
5 - MODEL_ID=Svenni551/Qwen3-Embedding-0.6B-ONNX-INT8
6 - POOLING=mean
7 - MAX_CLIENT_BATCH_SIZE=8
8 - MAX_BATCH_TOKENS=2048
9 - AUTO_TRUNCATE=true
10 volumes:
11 - ./data:/data
12 ports:
13 - "8080:80"pip install optimum[onnxruntime] transformers1from optimum.onnxruntime import ORTModelForFeatureExtraction
2from transformers import AutoTokenizer
3import torch
4
5model_id = "Svenni551/Qwen3-Embedding-0.6B-ONNX-INT8"
6
7# Load Tokenizer and ONNX Model
8tokenizer = AutoTokenizer.from_pretrained(model_id)
9model = ORTModelForFeatureExtraction.from_pretrained(model_id)
10
11# Input text
12sentences = ["This is an example sentence.", "Qwen3 is a powerful model."]
13
14# Tokenize
15inputs = tokenizer(sentences, padding=True, truncation=True, return_tensors="pt")
16
17# Perform Inference
18with torch.no_grad():
19 outputs = model(**inputs)
20
21# Mean Pooling
22attention_mask = inputs['attention_mask']
23token_embeddings = outputs.last_hidden_state
24input_mask_expanded = attention_mask.unsqueeze(-1).expand(token_embeddings.size()).float()
25embeddings = torch.sum(token_embeddings * input_mask_expanded, 1) / torch.clamp(input_mask_expanded.sum(1), min=1e-9)
26
27print(f"Embeddings shape: {embeddings.shape}")