Views
No views yet
UBC-NLP/marbertv2
Model type: Sequence Classification (Binary: EOU vs CONTINUE)
Language: Arabic (Saudi dialect focus)
Trained on: 30,000 examples (≈15k positive + 15k negative)
Framework: Hugging Face Transformers[SEP] token. This allows turn-aware predictions, rather than relying solely on the last utterance.UBC-NLP/marbertv20: CONTINUE1: EOUhidden_dropout_prob = 0.3attention_probs_dropout_prob = 0.3eval_loss1from transformers import AutoTokenizer, AutoModelForSequenceClassification
2import torch
3
4# Load model and tokenizer
5model_name = "salmamohammedhamed22/arabic-eou-model"
6tokenizer = AutoTokenizer.from_pretrained(model_name)
7model = AutoModelForSequenceClassification.from_pretrained(model_name)
8
9# Example input with context
10text = "مرحبا كيف حالك [SEP] تمام الحمد لله."
11
12inputs = tokenizer(text, return_tensors="pt")
13outputs = model(**inputs)
14probs = torch.softmax(outputs.logits, dim=-1)
15print(f"EOU probability: {probs[0][1].item():.3f}") # probability of end-of-utterance