Views
No views yet
| Name | Quant method | Size |
|---|---|---|
| TinyLlama-1.1B-indo-v1.Q2_K.gguf | Q2_K | 0.4GB |
| TinyLlama-1.1B-indo-v1.IQ3_XS.gguf | IQ3_XS | 0.44GB |
| TinyLlama-1.1B-indo-v1.IQ3_S.gguf | IQ3_S | 0.47GB |
| TinyLlama-1.1B-indo-v1.Q3_K_S.gguf | Q3_K_S | 0.47GB |
| TinyLlama-1.1B-indo-v1.IQ3_M.gguf | IQ3_M | 0.48GB |
| TinyLlama-1.1B-indo-v1.Q3_K.gguf | Q3_K | 0.51GB |
| TinyLlama-1.1B-indo-v1.Q3_K_M.gguf | Q3_K_M | 0.51GB |
| TinyLlama-1.1B-indo-v1.Q3_K_L.gguf | Q3_K_L | 0.55GB |
| TinyLlama-1.1B-indo-v1.IQ4_XS.gguf | IQ4_XS | 0.57GB |
| TinyLlama-1.1B-indo-v1.Q4_0.gguf | Q4_0 | 0.59GB |
| TinyLlama-1.1B-indo-v1.IQ4_NL.gguf | IQ4_NL | 0.6GB |
| TinyLlama-1.1B-indo-v1.Q4_K_S.gguf | Q4_K_S | 0.6GB |
| TinyLlama-1.1B-indo-v1.Q4_K.gguf | Q4_K | 0.62GB |
| TinyLlama-1.1B-indo-v1.Q4_K_M.gguf | Q4_K_M | 0.62GB |
| TinyLlama-1.1B-indo-v1.Q4_1.gguf | Q4_1 | 0.65GB |
| TinyLlama-1.1B-indo-v1.Q5_0.gguf | Q5_0 | 0.71GB |
| TinyLlama-1.1B-indo-v1.Q5_K_S.gguf | Q5_K_S | 0.71GB |
| TinyLlama-1.1B-indo-v1.Q5_K.gguf | Q5_K | 0.73GB |
| TinyLlama-1.1B-indo-v1.Q5_K_M.gguf | Q5_K_M | 0.73GB |
| TinyLlama-1.1B-indo-v1.Q5_1.gguf | Q5_1 | 0.77GB |
| TinyLlama-1.1B-indo-v1.Q6_K.gguf | Q6_K | 0.84GB |
| TinyLlama-1.1B-indo-v1.Q8_0.gguf | Q8_0 | 1.09GB |

1pip3 install --upgrade transformers optimum
2# If using PyTorch 2.1 + CUDA 12.x:
3pip3 install --upgrade auto-gptq
4# or, if using PyTorch 2.1 + CUDA 11.x:
5pip3 install --upgrade auto-gptq --extra-index-url https://huggingface.github.io/autogptq-index/whl/cu118/1pip3 uninstall -y auto-gptq
2git clone https://github.com/PanQiWei/AutoGPTQ
3cd AutoGPTQ
4git checkout v0.5.1
5pip3 install .1from transformers import AutoModelForCausalLM, AutoTokenizer, pipeline
2model_name_or_path = "daptheHuman/Merak-7B-v4-GPTQ"
3# To use a different branch, change revision
4# For example: revision="gptq-4bit-32g-actorder_True"
5model = AutoModelForCausalLM.from_pretrained(model_name_or_path,
6 device_map="auto",
7 trust_remote_code=False,
8 revision="main")
9tokenizer = AutoTokenizer.from_pretrained(model_name_or_path, use_fast=True)
10prompt = "Tell me about AI"
11prompt_template=f'''### Instruction:
12{prompt}
13### Response:
14'''
15print("\n\n*** Generate:")
16input_ids = tokenizer(prompt_template, return_tensors='pt').input_ids.cuda()
17output = model.generate(inputs=input_ids, temperature=0.7, do_sample=True, top_p=0.95, top_k=40, max_new_tokens=512)
18print(tokenizer.decode(output[0]))
19# Inference can also be done using transformers' pipeline
20print("*** Pipeline:")
21pipe = pipeline(
22 "text-generation",
23 model=model,
24 tokenizer=tokenizer,
25 max_new_tokens=512,
26 do_sample=True,
27 temperature=0.7,
28 top_p=0.95,
29 top_k=40,
30 repetition_penalty=1.1
31)
32print(pipe(prompt_template)[0]['generated_text'])