Views
No views yet
safetensors portsafetensors-packaged conversion of Charsiu's
g2p_multilingual_byT5_tiny_16_layers
multilingual grapheme-to-phoneme model.pytorch_model.bin and no tokenizer files. This
repo adds:model.safetensors — same weights, HF-standard T5 key naming, F32.config.json — upstream's config, with the stale local path stripped.tokenizer_config.json + special_tokens_map.json — byte-level byT5
tokenizer config (from google/byt5-small, which byT5 G2P uses).1from transformers import AutoTokenizer, T5ForConditionalGeneration
2
3tok = AutoTokenizer.from_pretrained("bearcove/g2p-multilingual-byT5-tiny-16-layers-mlx")
4model = T5ForConditionalGeneration.from_pretrained("bearcove/g2p-multilingual-byT5-tiny-16-layers-mlx")
5
6# Prepend the language tag, e.g. "<eng-us>: " for American English.
7inputs = tok(["<eng-us>: hello"], return_tensors="pt")
8out = model.generate(**inputs, num_beams=1, max_length=50)
9print(tok.batch_decode(out, skip_special_tokens=True)) # => ['ˈhɛɫoʊ']bee-g2p-charsiu-mlx crate. It reads model.safetensors directly via
mlx-rs.1use bee_g2p_charsiu_mlx::engine::G2pEngine;
2
3let mut engine = G2pEngine::load("path/to/model-dir")?;
4let ipa = engine.g2p("hello", "eng-us")?; // => "ˈhɛɫoʊ"eng-us for American English, eng-uk for British
English. See the
Charsiu language code table
for all 100 supported languages.1@inproceedings{zhu2022byt5,
2 title={{ByT5} model for massively multilingual grapheme-to-phoneme conversion},
3 author={Zhu, Jian and Zhang, Cong and Jurgens, David},
4 booktitle={Proc. Interspeech 2022},
5 year={2022},
6 eprint={2204.03067},
7 archivePrefix={arXiv}
8}