Views
No views yet
1!pip uninstall transformers -y && pip install --upgrade --no-cache-dir "git+https://github.com/huggingface/transformers.git"
2!pip uninstall unsloth -y && pip install --upgrade --no-cache-dir "unsloth[colab-new] @ git+https://github.com/unslothai/unsloth.git"
3!pip install datasets1from unsloth import FastLanguageModel
2import torch
3
4model_name = "sartifyllc/Pawa-kaggle-gemma-2b"
5max_seq_length = 2048
6dtype = None
7load_in_4bit = False
8
9model, tokenizer = FastLanguageModel.from_pretrained(
10 model_name=model_name,
11 max_seq_length=max_seq_length,
12 dtype=dtype,
13 load_in_4bit=load_in_4bit,
14)1from unsloth.chat_templates import get_chat_template
2FastLanguageModel.for_inference(model) # Enable native 2x faster inference
3
4tokenizer = get_chat_template(
5 tokenizer,
6 chat_template="chatml", # Supports templates like zephyr, chatml, mistral, etc.
7 mapping={"role": "from", "content": "value", "user": "human", "assistant": "gpt"}, # ShareGPT style
8 map_eos_token=True, # Maps <|im_end|> to </s>
9)1messages = [{"from": "human", "value": "Tengeneza hadithi fupi"}]
2inputs = tokenizer.apply_chat_template(
3 messages,
4 tokenize=True,
5 add_generation_prompt=True,
6 return_tensors="pt",
7).to("cuda")
8
9from transformers import TextStreamer
10text_streamer = TextStreamer(tokenizer)
11_ = model.generate(input_ids=inputs, streamer=text_streamer, max_new_tokens=128, use_cache=True)