Views
No views yet
pip install nm-vllm[sparse]1from vllm import LLM, SamplingParams
2
3model = LLM("nm-testing/llama2.c-stories110M-pruned50", sparsity="sparse_w16a16")
4prompt = "Hello my name is"
5
6sampling_params = SamplingParams(max_tokens=100, temperature=0)
7outputs = model.generate(prompt, sampling_params=sampling_params)
8print(outputs[0].outputs[0].text)recipe.yaml in this repo and follow the instructions below.1git clone https://github.com/neuralmagic/sparseml
2pip install -e "sparseml[transformers]"1import sparseml.transformers
2
3original_model_name = "Xenova/llama2.c-stories110M"
4calibration_dataset = "open_platypus"
5output_directory = "output/"
6
7recipe = """
8test_stage:
9 obcq_modifiers:
10 SparseGPTModifier:
11 sparsity: 0.5
12 sequential_update: true
13 targets: ['re:model.layers.\d*$']
14"""
15
16# Apply SparseGPT to the model
17sparseml.transformers.oneshot(
18 model=original_model_name,
19 dataset=calibration_dataset,
20 recipe=recipe,
21 output_dir=output_directory,
22)