Views
No views yet
optimum-habana for hardware acceleration.1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("AHAMED-27/VAGOsolutions-Llama-3-SauerkrautLM-8b-Instruct-openassistant-guanaco")
4model = AutoModelForCausalLM.from_pretrained("AHAMED-27/VAGOsolutions-Llama-3-SauerkrautLM-8b-Instruct-openassistant-guanaco")
5
6input_text = "Explain the benefits of using LoRA for fine-tuning large language models."
7inputs = tokenizer(input_text, return_tensors="pt")
8output = model.generate(**inputs)
9print(tokenizer.decode(output[0], skip_special_tokens=True))AutoTokenizer from the transformers library.q_proj, v_proj).