Views
No views yet
1from vllm import LLM, SamplingParams
2from transformers import AutoTokenizer
3
4model_id = "RedHatAI/Inkling-Small-FP8-dynamic"
5number_gpus = 4
6sampling_params = SamplingParams(temperature=0.6, top_p=0.95, top_k=20, min_p=0, max_tokens=256)
7
8tokenizer = AutoTokenizer.from_pretrained(model_id)
9messages = [{"role": "user", "content": "Give me a short introduction to large language model."}]
10prompts = tokenizer.apply_chat_template(messages, add_generation_prompt=True, tokenize=False)
11
12llm = LLM(model=model_id, tensor_parallel_size=number_gpus)
13outputs = llm.generate(prompts, sampling_params)
14generated_text = outputs[0].outputs[0].text
15print(generated_text)1from llmcompressor import model_free_ptq
2
3MODEL_ID = "thinkingmachines/Inkling-Small"
4SAVE_DIR = MODEL_ID.rstrip("/").split("/")[-1] + "-FP8-dynamic"
5
6model_free_ptq(
7 model_stub=MODEL_ID,
8 save_directory=SAVE_DIR,
9 scheme="FP8_DYNAMIC",
10 ignore=[
11 "model.llm.unembed",
12 "model.llm.embed",
13 "re:.*norm.*",
14 "re:.*bias$",
15 "re:.*\\.attn$",
16 "re:.*\\.attn\\..*",
17 "re:.*sconv$",
18 "re:.*gate.*",
19 "re:.*global_scale$",
20 "re:model\\.visual\\..*",
21 "re:model\\.audio\\..*",
22 ],
23 max_workers=2,
24)