Chinese to English Transformer
Model description
This model is a Transformer encoder-decoder designed for Chinese to English translation.
It follows the Attention Is All You Need architecture.
Training data
Helsinki-NLP/tatoeba_mt eng-zho dataset
Architecture
- num_layers: 2
- d_model: 256
- num_heads: 8
- dff: 1024
Tokenizers
SubwordTextEncoder used for both languages.