Views
No views yet
1from datasets import load_dataset
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4from llmcompressor import oneshot
5from llmcompressor.modifiers.awq import AWQModifier
6from llmcompressor.utils import dispatch_for_generation
7
8
9MODEL_ID = "meta-llama/Meta-Llama-3-8B"
10
11model = AutoModelForCausalLM.from_pretrained(MODEL_ID, torch_dtype="auto")
12tokenizer = AutoTokenizer.from_pretrained(MODEL_ID, trust_remote_code=True)
13tokenizer.chat_template = ("{% for message in messages %}{{ message['role'] }}: {{ message['content'] }}\n{% endfor %}")
14
15DATASET_ID = "HuggingFaceH4/ultrachat_200k"
16DATASET_SPLIT = "train_sft"
17
18NUM_CALIBRATION_SAMPLES = 512
19MAX_SEQUENCE_LENGTH = 2048
20ds = load_dataset(DATASET_ID, split=f"{DATASET_SPLIT}[:{NUM_CALIBRATION_SAMPLES}]")
21ds = ds.shuffle(seed=42)
22
23
24def preprocess(example):
25 return {
26 "text": tokenizer.apply_chat_template(
27 example["messages"],
28 tokenize=False,
29 )
30 }
31
32
33ds = ds.map(preprocess)
34
35
36def tokenize(sample):
37 return tokenizer(
38 sample["text"],
39 padding=False,
40 max_length=MAX_SEQUENCE_LENGTH,
41 truncation=True,
42 add_special_tokens=False,
43 )
44
45
46recipe = [
47 AWQModifier(ignore=["lm_head"], scheme="W4A16_ASYM", targets=["Linear"]),
48]
49
50oneshot(
51 model=model,
52 dataset=ds,
53 recipe=recipe,
54 max_seq_length=MAX_SEQUENCE_LENGTH,
55 num_calibration_samples=NUM_CALIBRATION_SAMPLES,
56)
57
58print("\n\n")
59print("========== SAMPLE GENERATION ==============")
60dispatch_for_generation(model)
61input_ids = tokenizer("Hello my name is", return_tensors="pt").input_ids.to(
62 model.device
63)
64output = model.generate(input_ids, max_new_tokens=100)
65print(tokenizer.decode(output[0]))
66print("==========================================\n\n")
67
68SAVE_DIR = MODEL_ID.rstrip("/").split("/")[-1] + "-awq-asym"
69try:
70 model.save_pretrained(SAVE_DIR, save_compressed=True)
71except ValueError:
72 print("Non-contiguous tensor issue detected, saving with safe_serialization=False")
73 model.save_pretrained(SAVE_DIR, safe_serialization=False)
74tokenizer.save_pretrained(SAVE_DIR)