Views
No views yet
While this setup is very likely sub-optimal, we see that back-translation greatly improves en2xx translation (by 3.0 chrf, in the case of Flores-200) in most cases.
ct2-transformers-converter --model jbochi/madlad400-7b-mt-bt --quantization int8_float16 --output_dir madlad400-7b-mt-bt-ct2-int8_float16 \
--copy_files added_tokens.json generation_config.json model.safetensors.index.json shared_vocabulary.json special_tokens_map.json spiece.model tokenizer.json tokenizer_config.jsontranslate_batch methon can be found at CTranslate2_Translator.translate_batch.1import ctranslate2
2import transformers
3
4translator = ctranslate2.Translator("avans06/madlad400-7b-mt-bt-ct2-int8_float16", compute_type="auto")
5tokenizer = transformers.AutoTokenizer.from_pretrained("jbochi/madlad400-7b-mt-bt")
6
7prefix = "<2zh> "
8input_text = "Who is Alan Turing?"
9input_tokens = tokenizer.convert_ids_to_tokens(tokenizer.encode(prefix + input_text))
10
11results = translator.translate_batch([input_tokens])
12
13output_tokens = results[0].hypotheses[0]
14output_text = tokenizer.decode(tokenizer.convert_tokens_to_ids(output_tokens))