Fraudrix is an intelligent message-risk classifier built for practical fraud defense across SMS, email, and URL-driven social engineering content. The system combines contextual text preprocessing, high-signal feature extraction, and a tuned classification pipeline to separate safe, spam, and scam traffic with high reliability.
Core Design
Fraudrix follows a data-first architecture:
Raw datasets are normalized into a unified format with two columns: message and label.
URL-based phishing records are transformed into contextual text so the model learns intent, not only links.
Curated scam phrases are injected to improve linguistic diversity for fraud patterns.
Balanced sampling stabilizes decision boundaries across safe, spam, and scam classes.
Training uses n-gram TF-IDF plus Logistic Regression for fast and robust inference.
Runtime prediction adds lightweight explainability signals for trust and auditability.
Inference Graph
mermaid
1flowchart LR
2 A[Incoming Message]--> B[Text Normalization]3 B --> C[Reason Signal Extraction]4 C --> D[TF-IDF Vectorization]5 D --> E[Logistic Regression Classifier]6 E --> F[Predicted Class]7 C --> G[Reason Summary]8 F --> H[Final Output]9 G --> H
Label Composition Graph
mermaid
1pie title Balanced Training Set Composition
2"safe": 7000
3"spam": 3000
4"scam": 3000
Model Details
Data Engineering
Unified schema: message, label
URL phishing enrichment for stronger contextual understanding
Supplemental curated scam corpus for linguistic coverage
Deduplication and null filtering before training
Feature Logic
Cleaner preserves lexical meaning while stripping noise
TF-IDF with ngram_range=(1,2)
Maximum features tuned for practical latency and stable quality
Classifier
Algorithm: Logistic Regression
Multiclass target: safe, spam, scam
Trained on balanced data for stronger minority-class recall
Explainability Layer
At inference time, Fraudrix reports why a message looks suspicious through compact reason tags such as:
sensitive financial keywords
promotional or spam keywords
contains link
This keeps outputs auditable without adding heavyweight model overhead.
Performance Snapshot
Latest benchmark from the current training pipeline: