Views
No views yet
| Model Name | #params | checkpoint | metrics |
|---|---|---|---|
| SeamlessM4T-Large v2 | 2.3B | checkpoint | metrics |
| SeamlessM4T-Large (v1) | 2.3B | checkpoint | metrics |
| SeamlessM4T-Medium (v1) | 1.2B | checkpoint | metrics |
metrics files above.1import torchaudio
2from transformers import AutoProcessor, SeamlessM4TModel
3processor = AutoProcessor.from_pretrained("facebook/hf-seamless-m4t-medium")
4model = SeamlessM4TModel.from_pretrained("facebook/hf-seamless-m4t-medium")1# Read an audio file and resample to 16kHz:
2audio, orig_freq = torchaudio.load("https://www2.cs.uic.edu/~i101/SoundFiles/preamble10.wav")
3audio = torchaudio.functional.resample(audio, orig_freq=orig_freq, new_freq=16_000) # must be a 16 kHz waveform array
4audio_inputs = processor(audios=audio, return_tensors="pt")
5
6# Process some input text as well:
7text_inputs = processor(text = "Hello, my dog is cute", src_lang="eng", return_tensors="pt")1audio_array_from_text = model.generate(**text_inputs, tgt_lang="rus")[0].cpu().numpy().squeeze()
2audio_array_from_audio = model.generate(**audio_inputs, tgt_lang="rus")[0].cpu().numpy().squeeze()generate_speech=False to SeamlessM4TModel.generate.1# from audio
2output_tokens = model.generate(**audio_inputs, tgt_lang="fra", generate_speech=False)
3translated_text_from_audio = processor.decode(output_tokens[0].tolist()[0], skip_special_tokens=True)
4
5# from text
6output_tokens = model.generate(**text_inputs, tgt_lang="fra", generate_speech=False)
7translated_text_from_text = processor.decode(output_tokens[0].tolist()[0], skip_special_tokens=True)seamless_communication librarym4t_predict <path_to_input_audio> --task s2st --tgt_lang <tgt_lang> --output_path <path_to_save_audio> --model_name seamlessM4T_mediumTranslator API:1import torch
2from seamless_communication.inference import Translator
3
4# Initialize a Translator object with a multitask model, vocoder on the GPU.
5translator = Translator("seamlessM4T_medium", "vocoder_36langs", torch.device("cuda:0"), torch.float16)
6text_output, speech_output = translator.predict(
7 input=<path_to_input_audio>,
8 task_str="S2ST",
9 tgt_lang=<tgt_lang>,
10 text_generation_opts=text_generation_opts,
11 unit_generation_opts=unit_generation_opts
12)1@article{seamlessm4t2023,
2 title={"SeamlessM4T—Massively Multilingual \& Multimodal Machine Translation"},
3 author={{Seamless Communication}, Lo\"{i}c Barrault, Yu-An Chung, Mariano Cora Meglioli, David Dale, Ning Dong, Paul-Ambroise Duquenne, Hady Elsahar, Hongyu Gong, Kevin Heffernan, John Hoffman, Christopher Klaiber, Pengwei Li, Daniel Licht, Jean Maillard, Alice Rakotoarison, Kaushik Ram Sadagopan, Guillaume Wenzek, Ethan Ye, Bapi Akula, Peng-Jen Chen, Naji El Hachem, Brian Ellis, Gabriel Mejia Gonzalez, Justin Haaheim, Prangthip Hansanti, Russ Howes, Bernie Huang, Min-Jae Hwang, Hirofumi Inaguma, Somya Jain, Elahe Kalbassi, Amanda Kallet, Ilia Kulikov, Janice Lam, Daniel Li, Xutai Ma, Ruslan Mavlyutov, Benjamin Peloquin, Mohamed Ramadan, Abinesh Ramakrishnan, Anna Sun, Kevin Tran, Tuan Tran, Igor Tufanov, Vish Vogeti, Carleigh Wood, Yilin Yang, Bokai Yu, Pierre Andrews, Can Balioglu, Marta R. Costa-juss\`{a} \footnotemark[3], Onur \,{C}elebi,Maha Elbayad,Cynthia Gao, Francisco Guzm\'an, Justine Kao, Ann Lee, Alexandre Mourachko, Juan Pino, Sravya Popuri, Christophe Ropers, Safiyyah Saleem, Holger Schwenk, Paden Tomasello, Changhan Wang, Jeff Wang, Skyler Wang},
4 journal={ArXiv},
5 year={2023}
6}