Views
No views yet
BAAI/bge-m3, оптимизированная для быстрого инференса на CPU.1import torch
2from sentence_transformers import SentenceTransformer
3
4# 1. Загружаем базовую архитектуру и веса на CPU
5model = SentenceTransformer('BAAI/bge-m3', device='cpu')
6
7# 2. Заменяем веса на квантованные (скачанные из этого репозитория)
8# model.load_state_dict(torch.load('pytorch_model.bin', map_location='cpu'))
9
10# 3. Применяем динамическую квантизацию (обязательный шаг!)
11model = torch.quantization.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8)
12
13# Теперь модель готова к работе
14embeddings = model.encode(["Пример текста"])