Views
No views yet
bits, group_size = 4, 128 autoround = AutoRound(model, tokenizer, nsamples=512, iters=1000, low_gpu_mem_usage=False, bits=bits, group_size=group_size) autoround.quantize() output_dir = "./tmp_autoround" autoround.save_quantized(output_dir, format='auto_gptq', inplace=True)