Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3# Load quantized model
4model = AutoModelForCausalLM.from_pretrained(
5 "Sambhavnoobcoder/gpt2-test-quantization-Quanto-int8-Quanto-int8-Quanto-int8",
6 device_map="auto"
7)
8
9tokenizer = AutoTokenizer.from_pretrained("Sambhavnoobcoder/gpt2-test-quantization-Quanto-int8-Quanto-int8-Quanto-int8")
10
11# Generate text
12inputs = tokenizer("Hello, my name is", return_tensors="pt").to(model.device)
13outputs = model.generate(**inputs, max_length=50)
14print(tokenizer.decode(outputs[0]))| Metric | Value |
|---|---|
| Memory Reduction | ~50% |
| Quality Retention | 99%+ |
| Inference Speed | 2-4x faster |
https://Sambhavnoobcoder-quantization-mvp.hf.space/webhook1@software{quanto_quantization,
2 title = {Quanto: PyTorch Quantization Toolkit},
3 author = {HuggingFace Team},
4 year = {2024},
5 url = {https://github.com/huggingface/optimum-quanto}
6}