Views
No views yet
1import torch
2from transformers import T5EncoderModel
3from optimum.quanto import (
4 QuantizedTransformersModel,
5 qfloat8_e4m3fn,
6 qfloat8_e5m2,
7 qint8,
8 qint4,
9)
10
11REPO_NAME = "black-forest-labs/FLUX.1-schnell"
12TEXT_ENCODER = "text_encoder_2"
13
14model = T5EncoderModel.from_pretrained(
15 REPO_NAME, subfolder=TEXT_ENCODER, torch_dtype=torch.bfloat16
16)
17qmodel = QuantizedTransformersModel.quantize(
18 model,
19 weights=qfloat8_e4m3fn,
20)
21qmodel.save_pretrained("./t5_xxl/qfloat8_e4m3fn")QuantizedTransformersModel does not support load a quantized model from huggingface hub.1from transformers import T5EncoderModel, AutoModelForTextEncoding
2from optimum.quanto import QuantizedTransformersModel
3
4MODEL_PATH = "./t5_xxl/qfloat8_e4m3fn"
5
6class QuantizedModelForTextEncoding(QuantizedTransformersModel):
7 auto_class = AutoModelForTextEncoding
8
9qmodel = QuantizedModelForTextEncoding.from_pretrained(
10 "./t5_xxl/qint8",
11)