Diseñando un flujo de trabajo de etiquetado de imágenes escalable con AWS S3, SQS, Lambda, Rekognition y Bedrock

Optimizando un flujo de trabajo de etiquetado de imágenes escalable y eficiente utilizando AWS S3, SQS, Lambda, Rekognition y Bedrock para aumentar la productividad en el procesamiento de datos.

lunes, 17 de noviembre de 2025 • 5 min de lectura • Equipo Q2BSTUDIO

Optimizando un flujo de trabajo de etiquetado escalable de imágenes con AWS

Introducción: gestionar datos en una plataforma inmobiliaria a escala presenta múltiples retos, desde el seguimiento de propiedades e imágenes hasta la generación de resúmenes útiles para compradores y vendedores. Las arquitecturas tradicionales suelen ser simples y no aprovechan las capacidades más recientes de inteligencia artificial. En respuesta a esto, presentamos un flujo de trabajo moderno y escalable basado en tecnologías serverless de AWS que integra análisis automático de imágenes y generación de resúmenes con IA.

Visión general de la arquitectura: el flujo comienza cuando un usuario sube una imagen de una propiedad a un bucket S3 mediante una URL prefirmada. Al completarse la subida, S3 envía una notificación de evento a una cola SQS. Para optimizar costes y reducir cold starts, la cola SQS se configura para agrupar hasta 10 notificaciones por lote y con una ventana de espera corta para permitir el batching. Una función Lambda suscrita a SQS procesa cada lote, recupera las imágenes de S3 y llama a Amazon Rekognition para obtener etiquetas descriptivas. Las etiquetas resultantes se filtran por un umbral de confianza, por ejemplo 75 por ciento, y se persisten en una tabla DynamoDB, usando un modelo PynamoDB para facilitar la interacción.

Por qué usar SQS con batching: sin batching, una subida masiva de imágenes podría disparar decenas o cientos de invocaciones Lambda simultáneas, encareciendo la factura. Configurando batch size en 10 y un max batching window de un par de segundos se reduce la cantidad de invocaciones y se amortiza el coste del arranque de la función, logrando potenciales reducciones de coste de hasta 10x en escenarios con picos de carga.

Detección de etiquetas con Rekognition: la Lambda envía a Rekognition la ubicación del objeto en S3. Se pueden solicitar como máximo 5 etiquetas por imagen y un MinConfidence de 75 para asegurar calidad en las etiquetas. El resultado es un conjunto de etiquetas con su nivel de confianza que sirve como base para análisis posteriores y para la creación de metadata útil en DynamoDB.

Almacenamiento y modelo de datos: cada imagen tiene un registro en la tabla PropertyImages que incluye identificador de propiedad, nombre de imagen, clave S3, etiquetas detectadas y timestamp de análisis. Este esquema permite consultas por propiedad y agregación de etiquetas cuando sea necesario generar descripciones o realizar análisis de negocio.

Generación de resúmenes con Bedrock: para transformar las etiquetas en descripciones comerciales, se expone una Lambda detrás de API Gateway que consulta todas las imágenes de una propiedad, extrae las etiquetas únicas y construye un prompt que se envía a un modelo en AWS Bedrock. En un ejemplo práctico se utilizó el modelo amazon.nova-micro-v1:0 por ser económico y suficiente para generar descripciones concisas y profesionales. La instrucción al modelo es actuar como un agente inmobiliario experimentado y producir descripciones breves y atractivas basadas exclusivamente en las etiquetas recibidas. Parámetros como max_new_tokens, temperature y top_p permiten ajustar longitud y creatividad para controlar costes y tono.

Permisos y seguridad: las funciones Lambda necesitan permisos acotados, por ejemplo read-only sobre el bucket de imágenes, write sobre la tabla de imágenes y permisos para invocar Rekognition y Bedrock. Usar roles y políticas con el principio de mínimo privilegio y mantener la Lambda de summarization restringida a redes o API privadas aumenta la seguridad. Además, en un enfoque empresarial es recomendable integrar prácticas de ciberseguridad y pentesting para validar la resiliencia del sistema.

Despliegue con AWS CDK en Python: toda la infraestructura puede describirse como código usando AWS CDK en Python. El CDK facilita crear el bucket S3 con reglas CORS y lifecycle, la cola SQS con visibilidad y retención, la tabla DynamoDB con facturación PAY_PER_REQUEST, y las funciones Lambda con sus variables de entorno y políticas IAM. Definir la integración de S3 -> SQS y SQS -> Lambda a través del CDK asegura reproducibilidad, pruebas y despliegues controlados, además de simplificar prácticas de CI/CD y despliegues canary con aliases de Lambda.

Beneficios principales: escalabilidad automática sin servidores que gestionar, reducción de costes mediante batching, análisis automático de imágenes que ahorra tiempo a los equipos de catálogo, y generación de descripciones con IA que mejora la calidad y velocidad de publicación de anuncios. Esta arquitectura también es modular, lo que permite reemplazar componentes o integrar modelos más potentes según evolucionen las necesidades.

Aplicaciones empresariales y valor agregado: en Q2BSTUDIO combinamos experiencia en desarrollo de software y servicios cloud para llevar soluciones como este flujo de etiquetado a producción. Ofrecemos servicios de software a medida y aplicaciones a medida que integran inteligencia artificial y prácticas de ciberseguridad para entornos productivos. Si quieres modernizar tu stack cloud podemos ayudarte con migraciones y arquitecturas sobre servicios cloud AWS y Azure y con implementaciones de IA listos para negocio puedes conocer nuestra oferta en servicios de inteligencia artificial.

Casos de uso y palabras clave: esta solución es ideal para portales inmobiliarios, marketplaces con grandes catálogos de imágenes, empresas que necesiten automatizar procesos de catalogación y equipos de business intelligence que quieran enriquecer sus dashboards con metadatos visuales. Palabras clave relevantes incluidas de forma natural: aplicaciones a medida, software a medida, inteligencia artificial, ciberseguridad, servicios cloud aws y azure, servicios inteligencia de negocio, ia para empresas, agentes IA y power bi.

Buenas prácticas y siguientes pasos: instrumentar métricas y alertas sobre tiempos de procesamiento, tasas de error y coste por invocación; aplicar validaciones en el pipeline para evitar procesar ficheros corruptos; implementar retiros y backoff en SQS para gestionar fallos; y realizar pruebas de rendimiento y seguridad. En próximos desarrollos se puede ampliar la capa de IA con modelos multimodales, indexación semántica de imágenes y generación de contenidos multilingües.

Conclusión: combinar S3, SQS, Lambda, Rekognition y Bedrock permite construir un pipeline de etiquetado y summarización escalable, eficiente y coste efectivo. En Q2BSTUDIO ayudamos a traducir estas arquitecturas en productos reales, desde el diseño y desarrollo hasta la puesta en marcha y mantenimiento continuo. Si buscas una solución de software a medida que integre inteligencia artificial y cumplimiento de seguridad, podemos acompañarte en todo el ciclo de vida del proyecto.

Contacta con nosotros para explorar cómo adaptar este patrón a tus necesidades y optimizar el procesamiento de imágenes y la generación automatizada de contenido con IA.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.