Views
No views yet
1pip3 install --upgrade transformers optimum
2# If using PyTorch 2.1 + CUDA 12.x:
3pip3 install --upgrade auto-gptq
4# or, if using PyTorch 2.1 + CUDA 11.x:
5pip3 install --upgrade auto-gptq --extra-index-url https://huggingface.github.io/autogptq-index/whl/cu118/1pip3 uninstall -y auto-gptq
2git clone https://github.com/PanQiWei/AutoGPTQ
3cd AutoGPTQ
4git checkout v0.5.1
5pip3 install .1
2from transformers import AutoTokenizer, TextGenerationPipeline,AutoModelForCausalLM
3from auto_gptq import AutoGPTQForCausalLM, BaseQuantizeConfig
4pretrained_model_dir = "iproskurina/bloom-560m-gptq-4bit"
5tokenizer = AutoTokenizer.from_pretrained(pretrained_model_dir, use_fast=True)
6model = AutoGPTQForCausalLM.from_quantized(pretrained_model_dir, device="cuda:0", model_basename="model")
7pipeline = TextGenerationPipeline(model=model, tokenizer=tokenizer)
8print(pipeline("auto-gptq is")[0]["generated_text"])pip install -v gptqmodel=="1.8.0" --no-build-isolation
from gptqmodel import GPTQModel
model_id = 'iproskurina/bloom-560m-GPTQ-4bit-g128'
model = GPTQModel.load(model_id)
result = model.generate("Uncovering deep insights")[0] # tokens
print(model.tokenizer.decode(result)) # string output