Views
No views yet
bitsandbytes to reduce memory usage and improve inference efficiency.TinyLlama/TinyLlama-1.1B-Chat-v1.0allenai/sciq (Science QA)bitsandbytesq_proj, v_proj (via LoRA)1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("TechyCode/tinyllama-sciq-lora")
4tokenizer = AutoTokenizer.from_pretrained("TechyCode/tinyllama-sciq-lora")
5
6prompt = """Question: What is the boiling point of water?\nChoices:\nA. 50°C\nB. 75°C\nC. 90°C\nD. 100°C\nAnswer:"""
7inputs = tokenizer(prompt, return_tensors="pt")
8outputs = model.generate(**inputs, max_new_tokens=20)
9print(tokenizer.decode(outputs[0], skip_special_tokens=True))
10