Views
No views yet
Lưu ý: đừng nhầm với DanVP/MoxhiMT-30 — một model khác (8 encoder / 2 decoder, ~37M) dùng vocab khác, không tương thích với bộ ONNX/tokenizer này.
| File | Kích thước | Ghi chú |
|---|---|---|
onnx/encoder_model_quantized.onnx | ~26 MB | int8 động (QUInt8, per-channel) — mặc định cho WASM |
onnx/decoder_model_merged_quantized.onnx | ~29 MB | int8 động, quantize cả subgraph của node If |
onnx/encoder_model_fp16.onnx / decoder_model_merged_fp16.onnx | ~51 / 57 MB | cho WebGPU |
onnx/encoder_model.onnx / decoder_model_merged.onnx | ~102 / 113 MB | fp32 gốc |
source.spm của model gốc là SentencePiece BPE (byte_fallback=true), vì vậy tokenizer.json
ở đây được dựng bằng tokenizers.models.BPE với merges trích từ spm (không dùng Unigram như
script chuyển đổi Marian thông thường — Unigram sẽ tách sai với spm kiểu BPE). Encode/decode đã
được kiểm tra khớp 100% với MarianTokenizer gốc.1import { pipeline } from '@huggingface/transformers';
2
3const translator = await pipeline('translation', 'DanVP/HachimiMT-30-zh-vi-onnx', {
4 dtype: 'q8', // hoặc { encoder_model: 'q8', decoder_model_merged: 'q8' }
5});
6const out = await translator('他抬起头,看见月光下的剑冢。', { max_new_tokens: 128 });
7// → "Hắn ngẩng đầu, nhìn thấy Kiếm Trủng dưới ánh trăng."num_beams: 1, và đặt
env.backends.onnx.wasm.numThreads = 1 trên iOS. Xem source của Space demo để tham khảo.text2text-generation-with-past), quantize bằng ONNX Runtime
(quantize_dynamic, EnableSubgraph=True).