Views
No views yet
facebook/nllb-200-distilled-600M, heavily optimized for translating Kalenjin (KLN) to Swahili (SWA).57.2470.53r=64, alpha=128, targeting ["q_proj", "v_proj", "k_proj", "out_proj", "fc1", "fc2"].luo_Latn token space to prevent catastrophic forgetting that comes with initializing a raw token.1import torch
2from peft import PeftModel
3from transformers import AutoModelForSeq2SeqLM, NllbTokenizerFast
4
5# Load Base
6model_id = "facebook/nllb-200-distilled-600M"
7model = AutoModelForSeq2SeqLM.from_pretrained(model_id)
8
9# Load Adapter
10adapter_id = "mutaician/nllb-kalenjin-swahili-v1"
11model = PeftModel.from_pretrained(model, adapter_id)
12
13# Load Tokenizer
14tokenizer = NllbTokenizerFast.from_pretrained(adapter_id)
15tokenizer.src_lang = "luo_Latn" # Important: Kalenjin routed via Luo token
16
17text = "Iyamunee"
18inputs = tokenizer(text, return_tensors="pt")
19
20target_lang_id = tokenizer.convert_tokens_to_ids("swa_Latn")
21
22with torch.no_grad():
23 generated_tokens = model.generate(
24 **inputs,
25 forced_bos_token_id=target_lang_id,
26 num_beams=5,
27 early_stopping=True,
28 max_length=256
29 )
30
31print(tokenizer.batch_decode(generated_tokens, skip_special_tokens=True)[0])
32