ConvNeXt-Tiny ajustado sobre PlantVillage
Clasificador de enfermedades foliares en 38 categorías, obtenido por ajuste fino de
facebook/convnext-tiny-224 sobre el conjunto PlantVillage.
Este modelo existe como
contrapunto arquitectónico de
ViT-Base/16: una red
convolucional moderna frente a un transformer, bajo condiciones de entrenamiento idénticas.
Comparar ViT contra otro transformer no habría dicho nada sobre atención frente a convolución.
Forma parte de FitoAsistente, proyecto final del curso de Inteligencia Artificial del
Magíster en Data Science de la Universidad San Sebastián.
Jonathan Núñez Moya · Francisco Rietta González · Agosto de 2026.
Uso
1from transformers import AutoImageProcessor, AutoModelForImageClassification
2from PIL import Image
3import torch
4
5proc = AutoImageProcessor.from_pretrained("JohnSupertramp2026/convnext-tiny-plantvillage")
6mod = AutoModelForImageClassification.from_pretrained("JohnSupertramp2026/convnext-tiny-plantvillage").eval()
7
8img = Image.open("hoja.jpg").convert("RGB")
9with torch.no_grad():
10 logits = mod(**proc(images=img, return_tensors="pt")).logits
11probs = torch.softmax(logits, dim=-1)[0]
12i = int(probs.argmax())
13print(mod.config.id2label[i], f"{probs[i]*100:.1f} %")
Datos y procedimiento
Idénticos a los del modelo con el que se compara: 20 % estratificado de PlantVillage con
semilla 42, partición 80/10/10 (8.688 / 1.086 / 1.087 imágenes), 3 épocas, lote 32,
AdamW con learning rate 5e-5, warmup 0,1, weight decay 0,01, fp16 sobre GPU T4, y selección
del mejor punto de control por macro F1 en validación.
Aumentación solo en entrenamiento: recorte aleatorio (escala 0,70-1,0), volteo horizontal y
rotación de ±15°.
Esa identidad de condiciones es el punto: la única variable libre entre los dos modelos es
la arquitectura.
Resultados
| Modelo | Preentrenamiento | Parámetros | Exactitud | Macro F1 | Weighted F1 | Latencia CPU | Tamaño |
|---|
| CNN desde cero (referencia) | No | 8,49 M | 59,60 % | 0,354 | 0,544 | — | 32,4 MB |
| ViT-Base/16 | ImageNet-21k | 85,83 M | 99,08 % | 0,988 | 0,991 | 395,0 ms | 327,4 MB |
| ConvNeXt-Tiny (este modelo) | ImageNet-1k | 27,85 M | 96,41 % | 0,919 | 0,960 | 119,6 ms | 106,2 MB |
Dónde gana este modelo. Tiene 3,1 veces menos parámetros que ViT, responde 3,3 veces más
rápido en CPU y ocupa un tercio en disco. En un despliegue con restricciones de latencia o en
un dispositivo móvil, es la elección correcta.
Dónde pierde, y por qué importa. La diferencia en exactitud frente a ViT es de 2,7 puntos,
pero en macro F1 es de 6,9. La razón es concreta: este modelo obtuvo F1 = 0,000 en
Potato___healthy -una clase con solo tres ejemplos en prueba, que no acertó ninguno- y
0,182 en Corn___Cercospora_leaf_spot, mientras que ViT resolvió ambas por encima de 0,900.
Abandonar las clases pequeñas es el mismo patrón que mostró la red entrenada desde cero.
Las dos arquitecturas coinciden en tres de sus cinco peores clases
(Corn___Cercospora_leaf_spot, Corn___Northern_Leaf_Blight y Tomato___Target_Spot):
cuando ambas fallan en lo mismo, la dificultad viene del problema y no del modelo.
Con más presupuesto el orden podría cambiar. Las curvas de entrenamiento muestran que este
modelo todavía venía subiendo en la tercera época -partió en 0,646 de macro F1 y llegó a
0,936-, mientras que ViT alcanzó 0,981 ya en la primera. Su cifra final probablemente
subestima su techo.
Limitaciones
- La exactitud está inflada por el agrupamiento de fotografías de una misma hoja física
repartidas entre entrenamiento y prueba. El sesgo afecta por igual a los modelos comparados.
- Laboratorio, no campo. Mohanty et al. (2016) documentaron una caída al 31 % en
fotografías de terreno.
- Abandona las clases con pocos ejemplos, como se detalla arriba. Si el caso de uso incluye
categorías minoritarias, conviene ViT.
- Conjunto cerrado, sin mecanismo de rechazo.
- No reemplaza el criterio de un profesional.
Referencias
- Liu, Z. et al. (2022). A ConvNet for the 2020s. IEEE/CVF CVPR, 11976-11986.
- Hughes, D. P. y Salathé, M. (2015). An open access repository of images on plant health. arXiv:1511.08060.
- Mohanty, S. P., Hughes, D. P. y Salathé, M. (2016). Using deep learning for image-based plant disease detection. Frontiers in Plant Science, 7, 1419.