Views
No views yet
| Branch | Bits | Description |
|---|---|---|
| 8_0 | 8.0 | Maximum quality that ExLlamaV2 can produce, near unquantized performance. |
| 6_5 | 6.5 | Very similar to 8.0, good tradeoff of size vs performance, recommended. |
| 5_0 | 5.0 | Slightly lower quality vs 6.5, but usable |
| 4_25 | 4.25 | GPTQ equivalent bits per weight, slightly higher quality. |
| 3_5 | 3.5 | Lower quality, only use if you have to. |
git clone --single-branch --branch 6_5 https://huggingface.co/firqaaa_-_indo-gemma-2b-alpaca-exl2 indo-gemma-2b-alpaca-6_5pip3 install huggingface-hub--revision parameter. For example, to download the 6.5 bpw branch:
Linux:huggingface-cli download firqaaa_-_indo-gemma-2b-alpaca-exl2 --revision 6_5 --local-dir indo-gemma-2b-alpaca-6_5 --local-dir-use-symlinks Falsehuggingface-cli download firqaaa_-_indo-gemma-2b-alpaca-exl2 --revision 6_5 --local-dir indo-gemma-2b-alpaca-6.5 --local-dir-use-symlinks False1# Prompt
2alpaca_prompt = """Di bawah ini adalah instruksi yang menjelaskan tugas, dipasangkan dengan masukan yang memberikan konteks lebih lanjut. Tulis tanggapan yang melengkapi instruksi dengan tepat.
3
4### Instruksi:
5{}
6
7### Masukan:
8{}
9
10### Tanggapan:
11{}"""
12
13max_seq_length = 4096 # Choose any! We auto support RoPE Scaling internally!
14dtype = None # None for auto detection. Float16 for Tesla T4, V100, Bfloat16 for Ampere+
15load_in_4bit = True # Use 4bit quantization to reduce memory usage. Can be False.
16
17if True:
18 from unsloth import FastLanguageModel
19 model, tokenizer = FastLanguageModel.from_pretrained(
20 model_name = "indo-gemma-2b-alpaca",
21 max_seq_length = max_seq_length,
22 dtype = dtype,
23 load_in_4bit = load_in_4bit
24 )
25 FastLanguageModel.for_inference(model) # Enable native 2x faster inference
26
27inputs = tokenizer(
28 [
29 alpaca_prompt.format(
30 "Sebutkan langkah-langkah membuat nasi goreng!",
31 "", # input
32 "", # output - leave this blank for generation!
33 )
34 ], return_tensors = "pt"
35).to("cuda")
36
37from transformers import TextStreamer
38text_streamer = TextStreamer(tokenizer)
39_ = model.generate(**inputs, streamer = text_streamer, max_new_tokens = 256)