Views
No views yet
olabs-ai/reflection_model is a fine-tuned language model based on Meta-Llama-3.1-8B-Instruct. It has been further fine-tuned using LoRA (Low-Rank Adaptation) for improved performance in specific tasks. This model is designed for text generation and can be used for various applications like conversational agents, content creation, and more.transformers and unsloth libraries installed. You can load the model and tokenizer as follows:1from transformers import AutoConfig, AutoModel, AutoTokenizer
2from unsloth import FastLanguageModel
3
4# Load base model configuration
5base_model_name = "olabs-ai/Meta-Llama-3.1-8B-Instruct"
6base_config = AutoConfig.from_pretrained(base_model_name)
7base_model = AutoModel.from_pretrained(base_model_name, config=base_config)
8tokenizer = AutoTokenizer.from_pretrained(base_model_name)
9
10# Load LoRA adapter
11adapter_config_path = "path_to_your_adapter_config.json"
12adapter_weights_path = "path_to_your_adapter_weights"
13
14# Use FastLanguageModel to apply LoRA adapter
15model = FastLanguageModel.from_pretrained(
16 model_name=base_model_name,
17 adapter_weights=adapter_weights_path,
18 config=adapter_config_path
19)
20
21# Set inference mode for LoRA
22FastLanguageModel.for_inference(model)
23
24# Prepare inputs
25custom_prompt = "What is a famous tall tower in Paris?"
26inputs = tokenizer([custom_prompt], return_tensors="pt").to("cuda")
27
28from transformers import TextStreamer
29text_streamer = TextStreamer(tokenizer)
30
31# Generate outputs
32outputs = model.generate(**inputs, streamer=text_streamer, max_new_tokens=1000)