Views
No views yet
TfidfVectorizer, que toma en cuenta la importancia de las palabras dentro de los documentos.LogisticRegression) para predecir el tipo de comida (española, italiana o japonesa).joblib para poder ser reutilizado sin necesidad de reentrenar.1import pandas as pd
2from sklearn.pipeline import make_pipeline
3from sklearn.feature_extraction.text import TfidfVectorizer
4from sklearn.linear_model import LogisticRegression
5import joblib
6
7# Cargar los datos directamente desde Hugging Face
8url = "https://huggingface.co/datasets/iabd10/comidas/resolve/main/comidas.csv"
9df = pd.read_csv(url)
10
11# Verificar la distribución de clases
12print("Distribución de clases:\n", df["tipo"].value_counts())
13
14# Separar las características (descripción) y las etiquetas (tipo de comida)
15X, y = df["descripcion"], df["tipo"]
16
17# Crear un pipeline con un TfidfVectorizer y Logistic Regression
18modelo = make_pipeline(TfidfVectorizer(), LogisticRegression(max_iter=200))
19
20# Entrenar el modelo
21modelo.fit(X, y)
22
23# Guardar el modelo
24joblib.dump(modelo, "clasificador_comidas.pkl")