Cómo Salesforce migró de Cluster Autoscaler a Karpenter en toda su flota de 1,000 clústeres de EKS

Descubre cómo Salesforce migró de Cluster Autoscaler a Karpenter en su flota de 1,000 clústeres de EKS, optimizando su infraestructura de manera eficiente.

domingo, 1 de febrero de 2026 • 4 min de lectura • Equipo Q2BSTUDIO

Salesforce migró de Cluster Autoscaler a Karpenter en su flota de 1,000 clústeres de EKS

Abordar una migracion masiva de un componente central de la plataforma de orquestacion de contenedores exige una mezcla de claridad tecnica, automatizacion y control de riesgos; cuando una organizacion con cientos o miles de clústeres decide reemplazar un mecanismo de escalado por otro, las decisiones no son solo tecnicas sino estrategicas. En este articulo describo un enfoque practico y replicable para cambiar de Cluster Autoscaler a Karpenter en una flota extensa de Amazon EKS, destacando retos operativos, criterios de diseño y beneficios medibles.

Por que considerar el cambio: Karpenter fue concebido para acelerar el aprovisionamiento de nodos, optimizar la colocacion de pods y reducir el tiempo entre la solicitud de recursos y su disponibilidad. En entornos donde los picos de demanda ocurren rapidamente, o donde se despliegan cargas intensivas en CPU o GPU para inteligencia artificial, la latencia de arranque de nodos y la eficiencia del bin packing influyen directamente en costes y experiencia de usuario.

Diferencias practicas a evaluar: Cluster Autoscaler opera ampliando y reduciendo grupos de nodos gestionados, mientras que Karpenter controla el ciclo de vida de instancias con provisioners declarativos que permiten mayor flexibilidad en la seleccion de tipos y en el uso de capacidad spot. A nivel de integracion esto implica cambios en IAM, en el manejo de etiquetas y tolerations, y en el planteamiento del escalado por zonas y capacidades mixtas.

Plan de migracion escalable: para una transicion segura en decenas o cientos de clústeres conviene seguir fases claras: auditoria inicial de cargas y patrones de uso, definicion de plantillas de provisioner estandarizadas, despliegue piloto sobre clusters representativos, validacion de metricas clave y finalmente automatizacion del rollout mediante pipelines y GitOps. Automatizar con IaC y pipelines permite aplicar un mismo conjunto de reglas y revisiones en toda la flota y facilita rollbacks controlados.

Automatizacion y operacion: la gestion centralizada de configuracion es imprescindible. Herramientas de entregas continuas como ArgoCD o Flux combinadas con plantillas parametrizadas evitan cambios manuales. Ademas, incorporar pruebas automatizadas que simulen picos de carga y fallos de spot ayuda a verificar el comportamiento del escalado. Para controlar despliegues a gran escala se pueden usar canary batches o feature gates que activan Karpenter gradualmente.

Seguridad y cumplimiento: migrar el componente de provisionamiento implica revisar permisos. Karpenter requiere roles y policies de IAM para crear y terminar instancias, asi que es recomendable auditar y aplicar el principio de privilegio minimo, integrar con procesos de compliance y asegurar que los logs y eventos de infraestructura queden centralizados para auditoria.

Observabilidad y metricas: medir es la unica forma de demostrar beneficio. Defina indicadores como tiempo medio de provisionamiento de nodo, tasa de pods pendientes, coste por CPU y memoria, y porcentaje de utilizacion. Utilizar telemetria existente en CloudWatch o Prometheus permite comparar antes y despues y detectar regresiones. Ademas, dashboards de inteligencia de negocio facilitan la comunicacion del impacto al area financiera y de producto.

Manejo de excepciones y resiliencia: en despliegues a gran escala aparecen escenarios atipicos, por ejemplo incompatibilidades con schedulers personalizados, limites de cuotas en la region o politicas internas que impidan ciertos tipos de instancia. Diseñar planes de contingencia que incluyan fallback a Cluster Autoscaler, uso temporario de nodos on demand y estrategias de prewarmed capacity mitiga riesgos.

Impacto en negocio y operaciones: un cambio bien ejecutado reduce el tiempo de provisionamiento, mejora la densidad de carga en los nodos y suele traducirse en ahorro de costes en infraestructura, ademas de liberar tiempo del equipo de operaciones para centrarse en proyectos de valor, como integracion de soluciones de inteligencia artificial o despliegues de nuevas aplicaciones a medida.

Lecciones practicas: estandarizar, automatizar y medir. Empezar por cargas no criticas, iterar rapido y documentar cada decision. En organizaciones que gestionan despliegues a gran escala, convertir la migracion en un proyecto con entregas incrementales y KPIs claros es clave para mantener continuidad del servicio.

Si su empresa enfrenta retos similares y necesita apoyo tecnico para planificar y ejecutar una migracion de este tipo, Q2BSTUDIO ofrece servicios cloud especializados que incluyen evaluacion, automatizacion y operacion sobre AWS y Azure y desarrollos de soluciones a medida para integrar la infraestructura con procesos de negocio. Podemos ayudar a definir provisioners, pipelines de despliegue y paneles de control que traduzcan telemetria en decisiones operativas y financieras; ademas contamos con experiencia en seguridad operativa para proteger los procesos de provisonamiento. Con equipos que trabajan en software a medida y en la implantacion de soluciones de inteligencia artificial y agentes IA para casos de uso empresarial, la combinacion de infraestructura y aplicacion permite obtener resultados medibles. Consulte como apoyamos migraciones cloud en servicios cloud aws y azure y explore opciones de desarrollo de plataformas y aplicaciones en aplicaciones a medida y software a medida.

En resumen, pasar de un enfoque tradicional de escalado a uno mas dinamico y orientado a eventos puede ofrecer ventajas operativas y economicas importantes, siempre que se aborde con una estrategia disciplinada, instrumentacion adecuada y controles de seguridad. La experiencia demuestra que con una buena planificacion y el apoyo tecnico correcto, la transicion puede realizarse con impacto minimo en la operacion diaria y con resultados que se reflejan rapidamente en indicadores de rendimiento y coste.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.