Una inmersión profunda en la falla del 18 de noviembre de 2025 de Cloudflare: lo que rompió Internet temporalmente
El 18 de noviembre de 2025 una modificación rutinaria en Cloudflare, la plataforma que alimenta cerca del 20 por ciento de la web, se transformó en una amarga lección para millones de usuarios. Sitios dejaron de responder, aplicaciones no cargaron y aparecieron páginas de error por doquier. Durante varias horas piezas centrales de la infraestructura global sufrieron las consecuencias, desde tiendas en línea hasta herramientas para desarrolladores. No fue un ataque malicioso masivo sino una cadena de errores provocada por un pequeño cambio que no tuvo en cuenta ciertos límites del sistema.
Qué vieron los usuarios: a eso de las 11:20 UTC muchas personas al intentar entrar en sus sitios favoritos se encontraron con una página de error genérica de Cloudflare indicando problemas en la red. Plataformas grandes y pequeñas se vieron afectadas porque Cloudflare actúa como un controlador del tráfico web, acelerando contenido, bloqueando bots y protegiendo contra ataques. Cuando ese controlador falla la experiencia de internet queda resentida. Por estimaciones el incidente interrumpió el acceso a millones de dominios alrededor del mundo.
La cronología resumida: a las 11:20 UTC comenzaron a aparecer errores 5xx a causa de fallos en el encaminamiento del tráfico. Entre las 11:20 y las 12:00 los ingenieros comprobaron dashboards saturados y la propia página de estado de Cloudflare presentó un fallo temporal, lo que aumentó la confusión. Entre las 12:00 y las 14:30 el equipo descartó un ataque DDoS y localizó el problema en un archivo de características usado por su sistema de gestión de bots. Recuperaron una versión anterior del archivo y entre las 14:30 y las 17:06 se trabajó en la limpieza y en absorber el repentino pico de tráfico de usuarios que intentaron reconectar. La parte más crítica duró aproximadamente tres horas y la recuperación total se extendió hasta entrada la tarde.
Qué falló técnicamente: imagina la red de Cloudflare como una autopista con múltiples carriles. Las peticiones entran cifradas, pasan por el proxy central llamado FL o Frontline, donde se aplican reglas de seguridad, aceleración y detección de bots, y luego, si hace falta, llegan a sistemas backend como Pingora para cache o para recuperar contenido del servidor origen. El componente que se rompió fue Bot Management, que asigna puntuaciones a cada petición usando aprendizaje automático para decidir si una petición es humana o un bot.
Ese scoring depende de un archivo de características que se actualiza cada pocos minutos desde ClickHouse, la base de datos analítica. Un cambio en los permisos de ClickHouse provocó que la consulta que genera ese archivo devolviera entradas duplicadas, duplicando el tamaño del archivo de la noche a la mañana. El software tenía un límite rígido en el tamaño aceptable del archivo. Cuando la versión agrandada se propagó por los servidores el módulo de detección de bots colapsó y las peticiones que necesitaban una puntuación recibieron errores 5xx. Servicios dependientes como Workers KV y Access sufrieron también fallos y latencias.
La situación se complicó por una migración en curso a una nueva versión del proxy, FL2. Los nodos en FL2 quedaron totalmente bloqueados mientras los nodos en la versión anterior devolvían puntuaciones erróneas que catalogaban peticiones como humanas. El resultado fue una mezcla de bloqueo completo en unos puntos de la red y falsas aperturas en otros, lo que dificultó aún más la recuperación.
La solución y las lecciones aprendidas: al identificar el archivo inflado el equipo detuvo su propagación y retrocedió a la versión previa, lo que restauró el enrutamiento central. Después hubo que gestionar el efecto rebaño cuando usuarios y servicios intentaron reconectar al mismo tiempo, provocando picos de carga secundarios. Cloudflare reconoció errores de diseño no documentado, pruebas insuficientes ante cambios de permisos y dependencia excesiva en un único archivo crítico. Entre las medidas futuras anunciadas están pruebas más estrictas para cambios de configuración, límites elásticos que escalen con el tamaño de datos y mayor redundancia en la puntuación de bots para eliminar puntos únicos de fallo.
Implicaciones para empresas y recomendaciones prácticas: incidentes como este subrayan la fragilidad de la cadena que sostiene la experiencia web. Si eres propietario de un sitio o responsable técnico conviene revisar estrategias de resiliencia como balanceo entre proveedores, planes de failover y pruebas de degradación. Para quienes desarrollamos soluciones a medida es esencial diseñar arquitecturas que toleren fallos en dependencias externas, implementar circuit breakers y preparar sistemas de caché locales que eviten dependencia absoluta de un proveedor.
Sobre Q2BSTUDIO: en Q2BSTUDIO somos una empresa de desarrollo de software especializada en aplicaciones a medida y software a medida, con experiencia en inteligencia artificial y ciberseguridad. Ayudamos a organizaciones a diseñar soluciones robustas que incluyen integraciones con servicios cloud aws y azure, despliegues tolerantes a fallos y prácticas de seguridad avanzadas. Ofrecemos además servicios de inteligencia artificial para empresas, agentes IA personalizados, análisis con power bi y proyectos de servicios inteligencia de negocio para convertir datos en decisiones accionables. También realizamos auditorías de seguridad y pentesting como parte de nuestras ofertas de ciberseguridad.
Si tu interés es modernizar sistemas para que resistan este tipo de incidentes, Q2BSTUDIO puede acompañarte en arquitecturas con redundancia, automatización de procesos, integración de agentes IA para monitorización inteligente y soluciones de business intelligence como power bi para visibilidad en tiempo real. Diversificar proveedores y aplicar buenas prácticas en despliegues es clave para reducir el impacto cuando una plataforma global experimenta interrupciones. En resumen, la caída del 18 de noviembre de 2025 fue una llamada de atención: defender la continuidad requiere diseño, pruebas y la combinación adecuada de tecnología y seguridad, algo en lo que desde Q2BSTUDIO estamos especializados.




