Ciencia de datos se encuentra con el vino: Construyendo un modelo para predecir calidad con precisión

Descubre cómo predecir la calidad del vino utilizando Ciencia de Datos. Aprende técnicas y herramientas para mejorar tus análisis enológicos.

martes, 9 de diciembre de 2025 • 5 min de lectura • Equipo Q2BSTUDIO

Prediciendo calidad del vino con Ciencia de Datos.

Introducción: en este estudio modelamos la calidad del vino y analizamos sus variables a través de métodos basados en datos. Empezamos con un análisis exploratorio y visualizaciones para descubrir patrones y relaciones en el conjunto de datos y luego construimos modelos de machine learning para predecir la calidad y cuantificar qué características influyen más en las puntuaciones. Con la disponibilidad de sistemas de valoración de usuarios a gran escala como Vivino, contamos con información representativa del gusto real de consumidores, complementando las evaluaciones tradicionales de expertos.

Recolección y limpieza de datos: los datos provienen de un repositorio público y contienen alrededor de 13 800 registros con columnas como nombre, tipo de vino, bodega, región, país, puntuación, número de valoraciones, precio y año. El dataset venía mayoritariamente limpio. Un detalle a resolver fue la aparición de N.V. en la columna año para vinos espumosos, que corresponde a Non Vintage y no a valor faltante. Para conservar esa información se sustituyó N.V. por el año promedio correspondiente a ese tipo de vino y se convirtió la columna a formato numérico. También se eliminaron los años que aparecían en los nombres de vino para uniformizar los registros.

Estructura básica y objetivo: la variable objetivo es la puntuación Rating. En el dataset la puntuación mínima es 2.2, la máxima 4.9 y la media 3.87. Para simplificar el problema se definieron tres clases de calidad basadas en la puntuación: baja para valores menores a 3.5, media para valores entre 3.6 y 4.5 y alta para valores superiores a 4.5. El objetivo del modelo es clasificar cada vino en una de esas tres categorías a partir de sus características.

Revisiones de relaciones y exploración: realizamos análisis de correlación entre variables numéricas. Se observó una relación débil a moderada entre precio y puntuación y una débil correlación negativa entre año y puntuación. Mapas de calor y gráficos de distribución muestran que la mayoría de las puntuaciones se concentran entre 3.5 y 4, lo que sugiere predominio de vinos de calidad media en la muestra.

Precio frente a calidad: la suposición habitual de que precio más alto implica mejor calidad no se confirma claramente en este dataset. Muchos vinos de precio bajo o medio reciben puntuaciones elevadas, por lo que el precio por sí solo no es un buen predictor de calidad. Esto tiene implicaciones comerciales: es posible posicionar productos económicos con alta percepción de calidad mediante estrategias de branding y control de calidad.

Influencia del país y la bodega: analizamos la calidad promedio por país entre 33 naciones incluidas en la muestra. Los países con mayor puntuación promedio fueron, en orden, Moldova, Líbano, Croacia, República Checa, Reino Unido, Georgia, Francia, Estados Unidos, Italia y Alemania. A nivel de productor, la mayoría de las bodegas presentan calificaciones medias a altas; solo un número reducido muestra promedios bajos. Estos hallazgos indican que tanto la procedencia como la bodega son factores relevantes para la calidad percibida.

Evolución con los años: al estudiar la puntuación promedio por añada observamos fluctuaciones. Entre 1960 y 1990 hubo una tendencia de mejora sostenida. De 1990 a 2000 se registraron altibajos y entre 2000 y 2020 se aprecia otra subida seguida de un descenso en las dos últimas décadas. La conclusión es que la calidad del vino varía con el tiempo y está sujeta a tendencias, prácticas de elaboración y cambios en el mercado.

Construcción del modelo de machine learning: para predecir la clase de calidad se utilizó un Random Forest Classifier en un enfoque supervisado. Antes del entrenamiento se realizó un preprocesamiento cuidadoso. Se añadió la columna Quality_Classification a partir de Rating. Se codificaron variables categóricas como País y Bodega reemplazándolas por su puntuación media para captar el efecto agregado. La columna Año se transformó en edad del vino. Las variables Precio y NbrOfRating se escalearon con la función logarítmica np.log1p para reducir la asimetría causada por valores extremos. Se eliminaron columnas no relevantes para el aprendizaje.

Entrenamiento y validación: se dividieron características X y etiquetas Y y se separaron en subconjuntos de entrenamiento y validación. Tras ajustar el modelo con X_train y Y_train se realizaron predicciones sobre X_validation y se evaluó la exactitud con accuracy_score. El modelo alcanzó una alta precisión en la partición de validación, lo que sugiere que las características seleccionadas capturan gran parte de la variabilidad asociada a la calidad. No obstante, para producción es recomendable comprobar la robustez con validación cruzada y métricas adicionales como recall y f1 por clase.

Implicaciones y comunicación de resultados: las conclusiones principales son que precio no es un predictor único y determinante, mientras que país, bodega, edad y otras características combinadas permiten predecir la calidad con buen rendimiento. Estos insights son útiles para bodegas, distribuidores y plataformas de comercio para optimizar catálogos, precios y recomendaciones.

Aplicaciones empresariales: en Q2BSTUDIO, empresa especializada en desarrollo de software y aplicaciones a medida, ayudamos a transformar este tipo de análisis en soluciones prácticas para el negocio. Diseñamos plataformas que integran procesos de ingestión de datos, modelos de machine learning y dashboards de inteligencia de negocio. Si necesita desarrollar una plataforma personalizada puede conocer nuestras soluciones en desarrollo de aplicaciones y software a medida. Para proyectos que requieran modelos de inteligencia artificial contamos con equipos expertos y servicios de consultoría en servicios de inteligencia artificial enfocados en ia para empresas, agentes IA y automatización inteligente.

Servicios complementarios: además ofertamos servicios de ciberseguridad y pentesting para proteger infraestructuras de datos, despliegues en la nube con servicios cloud aws y azure, y soluciones de inteligencia de negocio como power bi para visualización y reporting. Palabras clave como aplicaciones a medida, software a medida, inteligencia artificial, ciberseguridad, servicios cloud aws y azure, servicios inteligencia de negocio, ia para empresas, agentes IA y power bi resumen el portafolio con el que acompañamos a clientes en la adopción de tecnologías avanzadas.

Recomendaciones finales: para llevar un proyecto similar a producción se recomienda mantener un pipeline reproducible de limpieza y transformación de datos, monitorizar el rendimiento del modelo en tiempo real, y combinar modelos predictivos con visualizaciones interactivas para facilitar la toma de decisiones. Q2BSTUDIO puede acompañar en cada etapa, desde la ingeniería de datos hasta el despliegue seguro y escalable en la nube.

Contacto y siguiente paso: si desea que transformemos este análisis en una solución a medida para su negocio o explorar casos de uso con inteligencia artificial aplicada al sector alimentario y retail, nuestro equipo está listo para asesorarle y construir la plataforma que necesite.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.