Views
No views yet
transformers library. The model requires ~264GB of RAM and the following packages:pip install "torch==2.4.0" "transformers>=4.39.2" "tiktoken>=0.6.0" "bitsandbytes"hf_transfer package as described by Huggingface here.1pip install hf_transfer
2export HF_HUB_ENABLE_HF_TRANSFER=1read permission, and supply the token below.1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4tokenizer = AutoTokenizer.from_pretrained("PrunaAI/dbrx-instruct-bnb-4bit", trust_remote_code=True, token="hf_YOUR_TOKEN")
5model = AutoModelForCausalLM.from_pretrained("PrunaAI/dbrx-instruct-bnb-4bit", device_map="auto", torch_dtype=torch.bfloat16, trust_remote_code=True, token="hf_YOUR_TOKEN")
6
7input_text = "What does it take to build a great LLM?"
8messages = [{"role": "user", "content": input_text}]
9input_ids = tokenizer.apply_chat_template(messages, return_dict=True, tokenize=True, add_generation_prompt=True, return_tensors="pt").to("cuda")
10
11outputs = model.generate(**input_ids, max_new_tokens=200)
12print(tokenizer.decode(outputs[0]))pruna-engine is here on Pypi.