Views
No views yet
pip install nm-vllm[sparse]1from transformers import AutoTokenizer
2from vllm import LLM, SamplingParams
3
4model_id = "neuralmagic/TinyLlama-1.1B-Chat-v1.0-marlin"
5model = LLM(model_id)
6
7tokenizer = AutoTokenizer.from_pretrained(model_id)
8messages = [
9 {"role": "user", "content": "How to make banana bread?"},
10]
11formatted_prompt = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
12sampling_params = SamplingParams(max_tokens=200)
13outputs = model.generate(formatted_prompt, sampling_params=sampling_params)
14print(outputs[0].outputs[0].text)
15
16"""
17Sure! Here's a simple recipe for banana bread:
18
19Ingredients:
20- 3-4 ripe bananas,mashed
21- 1 large egg
22- 2 Tbsp. Flour
23- 2 tsp. Baking powder
24- 1 tsp. Baking soda
25- 1/2 tsp. Ground cinnamon
26- 1/4 tsp. Salt
27- 1/2 cup butter, melted
28- 3 Cups All-purpose flour
29- 1/2 tsp. Ground cinnamon
30
31Instructions:
32
331. Preheat your oven to 350 F (175 C).
34"""quantization/apply_gptq_save_marlin.py script:1pip install -r quantization/requirements.txt
2python3 quantization/apply_gptq_save_marlin.py --model-id TinyLlama/TinyLlama-1.1B-Chat-v1.0 --save-dir ./tinyllama-marlin