Views
No views yet
tr/ch, s/x, d/gi/r, l/n), âm cuối (c/t, n/ng, ch/t), vần (i/y, ươn/ương) và thanh điệu (hỏi/ngã).1import torch
2from transformers import AutoModelForSeq2SeqLM, AutoTokenizer
3
4model_name = "Toan2408/vit5-vietnamese-phonetic-eclm"
5device = "cuda" if torch.cuda.is_available() else "cpu"
6
7tokenizer = AutoTokenizer.from_pretrained(model_name)
8model = AutoModelForSeq2SeqLM.from_pretrained(model_name).to(device)
9
10def correct_text(text: str) -> str:
11 input_text = "sửa lỗi chính tả: " + text.strip().lower()
12 inputs = tokenizer(input_text, return_tensors="pt", max_length=64, truncation=True).to(device)
13
14 with torch.no_grad():
15 outputs = model.generate(**inputs, max_new_tokens=64, num_beams=3)
16 return tokenizer.decode(outputs[0], skip_special_tokens=True)
17
18# Ví dụ
19raw_asr_text = "có thể giúp ca quên đi những nỗi u phiền"
20print("Đầu ra ECLM:", correct_text(raw_asr_text))