Views
No views yet

1pip install transformers
21from transformers import AutoTokenizer, AutoModelForCausalLM
2
3tokenizer = AutoTokenizer.from_pretrained("lelapa/InkubaLM-0.4B",trust_remote_code=True)
4model = AutoModelForCausalLM.from_pretrained("lelapa/InkubaLM-0.4B",trust_remote_code=True)
5
6text = "Today I planned to"
7inputs = tokenizer(text, return_tensors="pt")
8input_ids = inputs.input_ids
9
10# Create an attention mask
11attention_mask = inputs.attention_mask
12
13# Generate outputs using the attention mask
14outputs = model.generate(input_ids, attention_mask=attention_mask, max_length=60,pad_token_id=tokenizer.eos_token_id)
15print(tokenizer.decode(outputs[0], skip_special_tokens=True))
161from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("lelapa/InkubaLM-0.4B", trust_remote_code=True)
4tokenizer = AutoTokenizer.from_pretrained("lelapa/InkubaLM-0.4B", trust_remote_code=True)
5
6model.to('cuda')
7text = "Today i planned to "
8input_ids = tokenizer(text, return_tensors="pt").to('cuda').input_ids
9outputs = model.generate(input_ids, max_length=1000, repetition_penalty=1.2, pad_token_id=tokenizer.eos_token_id)
10print(tokenizer.batch_decode(outputs[:, input_ids.shape[1]:-1])[0].strip())
111import torch
2from transformers import AutoTokenizer, AutoModelForCausalLM
3checkpoint = "lelapa/InkubaLM-0.4B"
4tokenizer = AutoTokenizer.from_pretrained(checkpoint)
5
6model = AutoModelForCausalLM.from_pretrained(checkpoint, device_map="auto",torch_dtype=torch.bfloat16, trust_remote_code=True)
7inputs = tokenizer.encode("Today i planned to ", return_tensors="pt").to("cuda")
8outputs = model.generate(inputs)
9print(tokenizer.decode(outputs[0]))
10pip install bitsandbytes accelerate1from transformers import AutoTokenizer, AutoModelForCausalLM, BitsAndBytesConfig
2quantization_config = BitsAndBytesConfig(load_in_8bit=True) # to use 4bit use `load_in_4bit=True` instead
3checkpoint = "lelapa/InkubaLM-0.4B"
4tokenizer = AutoTokenizer.from_pretrained(checkpoint)
5model = AutoModelForCausalLM.from_pretrained(checkpoint, quantization_config=quantization_config, trust_remote_code=True)
6inputs = tokenizer.encode("Today i planned to ", return_tensors="pt").to("cuda")
7outputs = model.generate(inputs)
8print(tokenizer.decode(outputs[0]))
9| Hyperparameter | Value |
|---|---|
| Total Parameters | 0.422B |
| Hidden Size | 2048 |
| Intermediate Size (MLPs) | 5632 |
| Number of Attention Heads | 32 |
| Number of Hidden Layers | 8 |
| RMSNorm ɛ | 1e^-5 |
| Max Seq Length | 2048 |
| Vocab Size | 61788 |
@article{tonja2024inkubalm,
title={InkubaLM: A small language model for low-resource African languages},
author={Tonja, Atnafu Lambebo and Dossou, Bonaventure FP and Ojo, Jessica and Rajab, Jenalea and Thior, Fadel and Wairagala, Eric Peter and Anuoluwapo, Aremu and Moiloa, Pelonomi and Abbott, Jade and Marivate, Vukosi and others},
journal={arXiv preprint arXiv:2408.17024},
year={2024}
}