meta-llama/Llama-3.2-1B. It was quantized using TorchAo.TorchAoConfig("int4_weight_only", group_size=128)Llama-3.2-1B-TORCHAO-W4, torch andtorchao need to be installed as:pip install torch torchao --upgradepip install transformers[accelerate] --upgrade1from transformers import AutoModelForCausalLM
2model = AutoModelForCausalLM.from_pretrained("Llama-3.2-1B-TORCHAO-W4")