Views
No views yet
1
2SONARForSpeech2Text.from_pretrained("tutur90/SONAR-Text-to-Text")
3
4NllbTokenizer.from_pretrained("tutur90/SONAR-Text-to-Text")
51
2inputs = tokenizer(sentence, langs=src_lang, return_tensors="pt")
3
4generated = sonar.generate(
5 **inputs,
6 target_lang_ids=[tokenizer.convert_tokens_to_ids(tgt_lang)],
7 max_length=128,
8 num_beams=1,
9 do_sample=False,
10 )
11decoded = tokenizer.batch_decode(generated, skip_special_tokens=True)[0]
12
13print(f"SONAR {src_lang} -> {tgt_lang}: {decoded}")
141
2encoder = SONARForText2Text.from_pretrained("tutur90/SONAR-Text-to-Text")
3
4encoder.set_encoder_only() # Delete decoder to save memory, this options is not needed
5
6inputs = tokenizer(sentence, langs=src_lang, return_tensors="pt")
7
8embeddings = encoder.encode(**inputs)
91
2decoder = SONARForText2Text.from_pretrained("tutur90/SONAR-Text-to-Text")
3
4decoder.set_decoder_only() # Same
5
6decoded = decoder.decode(
7 encoder_outputs,
8 target_lang_ids=[tokenizer.convert_tokens_to_ids(tgt_lang)],
9 max_length=128,
10 num_beams=1,
11 do_sample=False,
12 )
13decoded = tokenizer.batch_decode(decoded, skip_special_tokens=True)[0]
14
15