Views
No views yet
1from transformers import AutoTokenizer, TextGenerationPipeline
2from auto_gptq import AutoGPTQForCausalLM, BaseQuantizeConfig
3repo_name = "gurgutan/ruGPT-13B-4bit"
4# load tokenizer from Hugging Face Hub
5tokenizer = AutoTokenizer.from_pretrained(repo_name, use_fast=True)
6# download quantized model from Hugging Face Hub and load to the first GPU
7model = AutoGPTQForCausalLM.from_quantized(repo_name, device="cuda:0", use_safetensors=True, use_triton=False)
8# inference with model.generate
9request = "Буря мглою небо кроет"
10print(tokenizer.decode(model.generate(**tokenizer(request, return_tensors="pt").to(model.device))[0]))
11# or you can also use pipeline
12pipeline = TextGenerationPipeline(model=model, tokenizer=tokenizer)
13print(pipeline(request)[0]["generated_text"])
14