En este artículo resumimos la implementación de BSGAL sobre el dataset LVIS empleando el framework CenterNet2 con backbones ResNet-50 y Swin-L, y detallamos la estrategia de umbral dinámico diseñada para mejorar la detección en escenarios de larga cola.
Visión general
BSGAL se implementa como una capa de ajuste sobre la cabeza de detección de CenterNet2 para afrontar el desequilibrio inherente de LVIS. El método combina un esquema de muestreo balanceado por grupos de clases con una pérdida adaptativa por grupo y una política de umbral dinámico que ajusta la confianza mínima por grupo de frecuencia durante la inferencia.
Backbones y arquitectura
Probamos dos backbones: ResNet-50 para configuraciones de entrenamiento más ligeras y Swin-L para máxima capacidad de representación. Con ResNet-50 se emplea un optimizador SGD con momentum y una política de aprendizaje por pasos para convergencia estable, mientras que con Swin-L se utiliza AdamW y un scheduler coseno para aprovechar la mayor complejidad del transformador de visión. En ambos casos se integra mixed precision training para eficiencia y se mantienen las extensiones de CenterNet2 para boxes y keypoints cuando procede.
Estrategia de umbral dinámico
La estrategia de umbral dinámico consiste en calcular umbrales por grupo de frecuencia de clase (frecuentes, intermedias, raras) basados en las estadísticas de validación y ajustar esos umbrales durante la inferencia para maximizar mAP balanceado. En la práctica se define una función de umbral dependiente de la puntuación de confianza y la frecuencia de la clase, lo que reduce los falsos negativos en clases raras sin inflar falsos positivos en clases frecuentes.
Configuración de entrenamiento y augmentaciones
Entrenamientos típicos incluyen batches acumulados hasta 16 imágenes por iteración, tasas de aprendizaje iniciales entre 0.0001 y 0.01 según el backbone, decay por pesos y regularización L2. Se aplican augmentaciones fotométricas, flip horizontal, resize multi-escala y mezcla de ejemplos para mejorar robustez en clases con pocas muestras. Uso de validation splits estratificados por frecuencia para ajustar los umbrales dinámicos.
Métricas y resultados
La evaluación se realiza con métricas LVIS como AP por frecuencia y AP general. BSGAL tiende a mejorar significativamente el AP en clases raras y ofrece ganancias netas en mAP global al mitigar el sesgo hacia clases frecuentes, con costes computacionales moderados cuando se emplea Swin-L optimizado y mixed precision.
Despliegue y producción
Para llevar el modelo a producción recomendamos inferencia en GPU con batching y optimizaciones como TensorRT o TorchScript, y una capa de calibración de umbrales que se actualice periódicamente con nuevas anotaciones. Asimismo proponemos monitorizar métricas por clase y pipelines de reentrenamiento incremental para mantener el rendimiento en entornos reales.
Sobre Q2BSTUDIO
Q2BSTUDIO es una empresa de desarrollo de software especializada en soluciones a medida y servicios avanzados de inteligencia artificial. Ofrecemos desde diseño e implementación de aplicaciones a medida hasta integración de modelos de visión por computador en entornos cloud. Como compañía especializada en software a medida y aplicaciones a medida también proporcionamos servicios integrales en ciberseguridad, pentesting, servicios cloud aws y azure, servicios inteligencia de negocio y soluciones de ia para empresas y agentes IA. Si su proyecto requiere consultoría o desarrollo de modelos, en Q2BSTUDIO podemos ayudar con integraciones a medida y despliegues escalables, incluyendo pipelines con Power BI para reporting y monitorización.
Contacte con nosotros
Para proyectos de inteligencia artificial personalizados visite nuestra sección de soluciones de inteligencia artificial o descubra cómo desarrollamos aplicaciones a medida que integran IA, ciberseguridad y servicios cloud aws y azure para empresas que necesitan resultados fiables y escalables.




