Views
No views yet
1!pip install --no-deps packaging ninja einops peft accelerate bitsandbytes
2import torch
3from transformers import AutoModelForCausalLM, AutoTokenizer, TextStreamer
4from peft import PeftModel, PeftConfig
5
6# Load model and tokenizer configurations
7config = PeftConfig.from_pretrained("Vijayendra/llama3.0-8B-merged-4bit")
8base_model = AutoModelForCausalLM.from_pretrained("unsloth/llama-3-8b-bnb-4bit")
9model = PeftModel.from_pretrained(base_model, "Vijayendra/llama3.0-8B-merged-4bit")
10tokenizer = AutoTokenizer.from_pretrained("Vijayendra/llama3.0-8B-merged-4bit")
11
12# Ensure padding token is set for the tokenizer
13if tokenizer.pad_token is None:
14 tokenizer.pad_token = tokenizer.eos_token
15
16# Define the inference function with TextStreamer
17def generate_answer_with_stream(model, tokenizer, text, max_new_tokens=1024, temperature=0.5, top_k=40, top_p=0.9):
18 prompt = f"Answer the following question\n\n{text}\n\nQuestion:"
19
20 # Tokenize the input text
21 inputs = tokenizer(prompt, return_tensors="pt", padding=True, truncation=True).to(model.device)
22
23 # Initialize the TextStreamer
24 streamer = TextStreamer(tokenizer)
25
26 # Generate answer using the model with streaming
27 with torch.no_grad():
28 model.generate(
29 inputs.input_ids,
30 attention_mask=inputs.attention_mask,
31 max_new_tokens=max_new_tokens,
32 temperature=temperature,
33 do_sample=True,
34 top_k=top_k,
35 top_p=top_p,
36 repetition_penalty=1.2,
37 eos_token_id=tokenizer.eos_token_id,
38 pad_token_id=tokenizer.pad_token_id,
39 streamer=streamer # Stream output as it's generated
40 )
41
42# Input Question
43question = "What is quantum mechanics?"
44
45# Generate and print answer
46generate_answer_with_stream(model, tokenizer, question)
47
48