Views
No views yet
mistralai/Mistral-Small-24B-Instruct-2501transformerspip install transformers bitsandbytes accelerate1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig
3
4MODEL_NAME = "Noorhan/mistral-24b-4bit"
5
6# Configure quantization
7quantization_config = BitsAndBytesConfig(load_in_4bit=True)
8
9# Load tokenizer and model
10tokenizer = AutoTokenizer.from_pretrained(MODEL_NAME)
11model = AutoModelForCausalLM.from_pretrained(
12 MODEL_NAME,
13 device_map="auto",
14 quantization_config=quantization_config
15)
16
17# Generate response
18prompt = "Explain the concept of transformers in deep learning."
19inputs = tokenizer(prompt, return_tensors="pt").to("cuda" if torch.cuda.is_available() else "cpu")
20outputs = model.generate(**inputs, max_new_tokens=150)
21
22print(tokenizer.decode(outputs[0], skip_special_tokens=True))transformers| Metric | Full-Precision (FP16) | Quantized (4-bit bnb) |
|---|---|---|
| Memory Usage | ~50GB VRAM | ~10GB VRAM |
| Inference Speed | Medium | Faster (~1.5x on A100) |
| Quality Drop | None (Minimal loss) | Negligible |
mistralai/Mistral-Small-24B-Instruct-2501. Check Mistral AI’s terms of use.@misc{mistral24b-4bit,
title={Mistral-Small-24B-Instruct-2501 (4-bit Quantized)},
author={Noorhan},
year={2024},
publisher={Hugging Face},
url={https://huggingface.co/Noorhan/mistral-small-24b-4bit}
}