Views
No views yet
llmcompressor library to optimize it for high-performance inference with a reduced memory footprint.transformers and torch versions installed:1pip install torch torchvision transformers typing_extensions llmcompressor
21from transformers import AutoTokenizer, AutoModelForCausalLM
2
3MODEL_ID = "Akicou/INTELLECT-3-REAP-50-FP8-Dynamic"
4
5model = AutoModelForCausalLM.from_pretrained(
6 MODEL_ID,
7 device_map="auto",
8 torch_dtype="auto",
9)
10tokenizer = AutoTokenizer.from_pretrained(MODEL_ID)
11
12prompt = "Write a technical summary of how FP8 quantization improves LLM inference."
13inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
14
15output = model.generate(**inputs, max_new_tokens=150)
16print(tokenizer.decode(output[0], skip_special_tokens=True))
17
llmcompressor configuration:lm_head.oneshot algorithm.