Views
No views yet
outputs/submission_dev.zip and outputs/submission_full.zip1# Create an environment and install packages
2python -m venv .venv
3source .venv/bin/activate
4
5pip install -r requirements.txt1from datasets import load_dataset
2
3pub_data = load_dataset("weerayut/multilexnorm2026-pub")
4
5# Select a language
6lang = "en"
7en_train = pub_data["train"].filter(lambda x: x["lang"] == lang)
8en_val = pub_data["validation"].filter(lambda x: x["lang"] == lang)1import pandas as pd
2from utils import counting, mfr
3
4# Smoke test the baseline
5counts = counting(en_train)
6mfr(['bcause', 'u', 'r', 'funny'], counts)
7
8# Inference
9ds = pd.DataFrame(en_val)
10ds['pred'] = ds['raw'].apply(lambda x: mfr(x, counts))1from utils import evaluate
2
3evaluate(
4 raw=ds['raw'].tolist(), # list[list[str]]
5 gold=ds['norm'].tolist(), # list[list[str]]
6 pred=ds['pred'].tolist() # list[list[str]]
7)1Baseline acc.(LAI): 93.10
2Accuracy: 97.37
3ERR: 61.93