meta-llama/Llama-3.2-1B. It was quantized using TorchAo.TorchAoConfig("int8_weight_only")Llama-3.2-1B-TORCHAO-W8, torch andtorchao need to be installed as:pip install torch torchao --upgradepip install transformers[accelerate] --upgrade1from transformers import AutoModelForCausalLM
2model = AutoModelForCausalLM.from_pretrained("Llama-3.2-1B-TORCHAO-W8")