BGE-M3 Quantized (INT8)
Квантованная версия модели BAAI/bge-m3, полученная с использованием динамической квантизации PyTorch (torch.quantization.quantize_dynamic).
Описание
Модель была квантована до формата INT8 для уменьшения размера и ускорения инференса на CPU.
Используемый метод:
- Dynamic Quantization
- Линейные слои (
torch.nn.Linear)
- Тип данных:
torch.qint8
Исходная модель
- Base model: BAAI/bge-m3
- Framework: Sentence Transformers
- PyTorch
Содержимое репозитория
bge_m3_quantized.pt — веса квантованной модели (state_dict).
Назначение
Модель подготовлена в рамках домашней работы по квантизации энкодерных моделей для семантического поиска.
Примечание
Файл bge_m3_quantized.pt содержит только веса модели (state_dict). Для использования необходимо сначала загрузить базовую архитектуру BAAI/bge-m3, после чего загрузить сохраненные веса.