Views
No views yet
| Model Name | #params | checkpoint | metrics |
|---|---|---|---|
| [SeamlessM4T-Medium]((https://huggingface.co/facebook/seamless-m4t-medium) | 1.2B | checkpoint | metrics |
| SeamlessM4T-Large | 2.3B | checkpoint | metrics |
metrics files above.seamless_communication package. The seamless_communication
package can be installed by following the instructions outlined here: Installation.Translator
object can be instantiated to perform all five of the spoken langauge tasks. The Translator is instantiated with three arguments:seamlessM4T_medium for the medium model, or seamlessM4T_large for the large modelvocoder_36langs)1import torch
2from seamless_communication.models.inference import Translator
3
4
5# Initialize a Translator object with a multitask model, vocoder on the GPU.
6translator = Translator("seamlessM4T_medium", vocoder_name_or_card="vocoder_36langs", device=torch.device("cuda:0"))predict() method can be used to run inference as many times on any of the supported tasks.<path_to_input_audio> or an input text <input_text> in <src_lang>, we can translate
into <tgt_lang> as follows.1# S2ST
2translated_text, wav, sr = translator.predict(<path_to_input_audio>, "s2st", <tgt_lang>)
3
4# T2ST
5translated_text, wav, sr = translator.predict(<input_text>, "t2st", <tgt_lang>, src_lang=<src_lang>)<src_lang> must be specified for T2ST.1wav, sr = translator.synthesize_speech(<speech_units>, <tgt_lang>)
2
3# Save the translated audio generation.
4torchaudio.save(
5 <path_to_save_audio>,
6 wav[0].cpu(),
7 sample_rate=sr,
8)1# S2TT
2translated_text, _, _ = translator.predict(<path_to_input_audio>, "s2tt", <tgt_lang>)
3
4# ASR
5# This is equivalent to S2TT with `<tgt_lang>=<src_lang>`.
6transcribed_text, _, _ = translator.predict(<path_to_input_audio>, "asr", <src_lang>)
7
8# T2TT
9translated_text, _, _ = translator.predict(<input_text>, "t2tt", <tgt_lang>, src_lang=<src_lang>)
10<src_lang> must be specified for T2TT.1@article{seamlessm4t2023,
2 title={"SeamlessM4T—Massively Multilingual \& Multimodal Machine Translation"},
3 author={{Seamless Communication}, Lo\"{i}c Barrault, Yu-An Chung, Mariano Cora Meglioli, David Dale, Ning Dong, Paul-Ambroise Duquenne, Hady Elsahar, Hongyu Gong, Kevin Heffernan, John Hoffman, Christopher Klaiber, Pengwei Li, Daniel Licht, Jean Maillard, Alice Rakotoarison, Kaushik Ram Sadagopan, Guillaume Wenzek, Ethan Ye, Bapi Akula, Peng-Jen Chen, Naji El Hachem, Brian Ellis, Gabriel Mejia Gonzalez, Justin Haaheim, Prangthip Hansanti, Russ Howes, Bernie Huang, Min-Jae Hwang, Hirofumi Inaguma, Somya Jain, Elahe Kalbassi, Amanda Kallet, Ilia Kulikov, Janice Lam, Daniel Li, Xutai Ma, Ruslan Mavlyutov, Benjamin Peloquin, Mohamed Ramadan, Abinesh Ramakrishnan, Anna Sun, Kevin Tran, Tuan Tran, Igor Tufanov, Vish Vogeti, Carleigh Wood, Yilin Yang, Bokai Yu, Pierre Andrews, Can Balioglu, Marta R. Costa-juss\`{a} \footnotemark[3], Onur \,{C}elebi,Maha Elbayad,Cynthia Gao, Francisco Guzm\'an, Justine Kao, Ann Lee, Alexandre Mourachko, Juan Pino, Sravya Popuri, Christophe Ropers, Safiyyah Saleem, Holger Schwenk, Paden Tomasello, Changhan Wang, Jeff Wang, Skyler Wang},
4 journal={ArXiv},
5 year={2023}
6}