Views
No views yet
| Configuration | Explanation |
|---|---|
BASELINE | a reference functionally equivalent to the original model |
BASIC | all linear algebraic operands quantized to MXINT8-64 |
pip install dmx_compressor1from transformers import AutoModelForCausalLM, AutoTokenizer, AutoConfig
2from dmx.compressor import DmxModel
3import torch
4
5model_name = "d-matrix/Llama-3.1-70B"
6official_model = "meta-llama/Llama-3.1-70B"
7config = AutoConfig.from_pretrained(model_name, trust_remote_code=True)
8
9model = AutoModelForCausalLM.from_pretrained(
10 official_model,
11 config=config,
12 trust_remote_code=True,
13 device_map="auto",
14)
15model = DmxModel.from_torch(model)
16x = torch.rand(1, 1024)
17model(x)