Views
No views yet
Llama 3.1 8B Instruct. Quantized to 4-bit using bistandbytes and accelerate.1# Use a pipeline as a high-level helper
2from transformers import pipeline
3
4messages = [
5 {"role": "user", "content": "Who are you?"},
6]
7pipe = pipeline("text-generation", model="fsaudm/Meta-Llama-3.1-8B-Instruct-NF4")
8pipe(messages)1# Load model directly
2from transformers import AutoTokenizer, AutoModelForCausalLM
3
4tokenizer = AutoTokenizer.from_pretrained("fsaudm/Meta-Llama-3.1-8B-Instruct-NF4")
5model = AutoModelForCausalLM.from_pretrained("fsaudm/Meta-Llama-3.1-8B-Instruct-NF4")