Views
No views yet
1from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
2
3model_name = "mahimaaruna04/qwen-kannada-translation"
4tokenizer = AutoTokenizer.from_pretrained(model_name)
5model = AutoModelForSeq2SeqLM.from_pretrained(model_name)
6
7text = "Hello, how are you?"
8inputs = tokenizer(text, return_tensors="pt")
9outputs = model.generate(**inputs, max_new_tokens=60)
10print(tokenizer.decode(outputs[0], skip_special_tokens=True))
11
12## Training Details
13
14### Training Data
15- **Dataset:** Synthetic English↔Kannada parallel corpus generated using LLM prompting (Gemini/GPT).
16- **Format:** JSON (English sentence, Kannada translation).
17- **Balance:** 50% English → Kannada, 50% Kannada → English.
18- **Dataset Card:** [mahimaaruna04/kannada-english-translation-synthetic](https://huggingface.co/datasets/mahimaaruna04/kannada-english-translation-synthetic)
19
20---
21
22### Training Procedure
23
24#### Preprocessing
25- Cleaned and normalized text
26- Tokenization using `QwenTokenizer`
27- Dropped long or malformed translation pairs
28
29#### Training Hyperparameters
30- **Method:** LoRA (PEFT) fine-tuning
31- **Rank:** 8
32- **Alpha:** 16
33- **Dropout:** 0.05
34- **Batch size:** 8
35- **Learning rate:** 2e-4
36- **Epochs:** 3–5
37- **Precision:** bfloat16
38
39#### Speeds, Sizes, Times
40- **Training time:** ~2.5 hours on Colab T4
41- **Model size (LoRA-adapted):** ~1.9B effective parameters
42
43---
44
45## Evaluation
46
47### Testing Data, Factors & Metrics
48
49#### Testing Data
50- Held-out subset from the same dataset (500 pairs, balanced English↔Kannada)
51
52#### Metrics
53- BLEU (automatic)
54- Manual review for grammatical and contextual accuracy
55
56### Results
57
58| Metric | Direction | Score |
59|---------|------------|--------|
60| BLEU | EN → KN | 34.2 |
61| BLEU | KN → EN | 32.8 |
62
63> The fine-tuned model shows more fluent and context-aware translations compared to the base Qwen-1.8B, particularly for shorter conversational sentences.
64
65### Summary
66Even with synthetic data, the fine-tuning improves cross-lingual fluency, demonstrating the power of PEFT-based adaptation for low-resource languages.
67
68---
69
70## Citation & Acknowledgement
71
72Please cite the dataset if you use or refer to it:
73
74```bibtex
75@misc{mahima2025kannet,
76 title = {Kannada-English Translation Synthetic Dataset},
77 author = {Mahima Aruna},
78 year = {2025},
79 url = {https://huggingface.co/datasets/mahimaaruna04/kannada-english-translation-synthetic}
80}