Tessera: Desbloqueando GPUs Heterogéneas mediante Desagregación a Nivel de Kernel

Descubre cómo Tessera desagrega kernels en GPUs heterogéneas para acelerar la inferencia de modelos grandes hasta 2.3x, superando soluciones tradicionales.

11 jul 2026 • 5 min de lectura • Equipo Q2BSTUDIO

Desagregación de kernels para inferencia eficiente

El auge de los modelos de inteligencia artificial ha llevado a las empresas a buscar infraestructuras cada vez más potentes y flexibles. Sin embargo, la variedad de GPUs disponibles en el mercado —desde soluciones de alto rendimiento hasta opciones más económicas— plantea un desafío: cómo aprovechar al máximo un clúster heterogéneo sin perder eficiencia ni disparar los costes. Tradicionalmente, las estrategias de desagregación han operado a nivel de aplicación o de capa completa, asignando cargas de trabajo enteras a un tipo de GPU. Pero esta granularidad gruesa desperdicia oportunidades de optimización, ya que dentro de un mismo modelo de inferencia conviven kernels con perfiles de recursos muy distintos. Un nuevo enfoque, materializado en sistemas como Tessera, propone romper esa barrera y llevar la desagregación al nivel de kernel, es decir, al fragmento más pequeño de cómputo que se ejecuta en la GPU. Esta innovación promete transformar la manera en que las organizaciones despliegan inteligencia artificial en entornos heterogéneos.

La idea central es sencilla pero potente: si cada kernel dentro de una aplicación demanda una cantidad específica de memoria, ancho de banda y capacidad de cómputo, entonces lo lógico es emparejarlo con la GPU que mejor se adapte a esas necesidades. Por ejemplo, un kernel con alta demanda de memoria puede ejecutarse en una GPU con mayor VRAM, mientras que otro kernel con operaciones matriciales intensivas puede beneficiarse de una GPU con más núcleos CUDA. Hasta ahora, las soluciones existentes requerían que el modelo completo encajara en una sola GPU, o bien fragmentaban la carga a nivel de capas o bloques, lo que introducía complejidades de sincronización y dependencias difíciles de manejar. Tessera, en cambio, extrae las dependencias entre kernels directamente del código PTX, un lenguaje de bajo nivel de NVIDIA, y garantiza la corrección de la ejecución distribuida sin necesidad de modificar el modelo original.

¿Por qué esto es relevante para el mundo empresarial? Porque la inferencia de modelos grandes es uno de los cuellos de botella más costosos en la adopción de IA. Una empresa que ejecuta un asistente conversacional o un sistema de recomendación necesita minimizar la latencia y maximizar el throughput, pero también controlar el gasto en hardware. Con Tessera, un par de GPUs heterogéneas —una de gama alta y otra más modesta— puede superar el rendimiento de dos GPUs homogéneas de alta gama, reduciendo simultáneamente la inversión. Esto abre la puerta a que compañías de cualquier tamaño accedan a capacidades de inteligencia artificial que antes solo estaban al alcance de gigantes tecnológicos. Además, el sistema incorpora un modelo de ejecución en pipeline que superpone la comunicación con el cómputo, minimizando los tiempos muertos y aumentando la eficiencia global.

Detrás de esta capacidad técnica hay una lección más amplia: la especialización de hardware no es suficiente si no va acompañada de un software a medida que sepa orquestar los recursos de forma inteligente. Las empresas que quieran aprovechar las GPU heterogéneas —ya sea en sus centros de datos locales o mediante servicios cloud aws y azure— necesitarán soluciones de middleware que adapten dinámicamente la asignación de tareas. Tessera demuestra que es posible mediante una combinación de análisis offline (para conocer los requisitos de cada kernel) y adaptación online (para reaccionar a cambios en la carga o en la disponibilidad de GPUs). Este tipo de desarrollo requiere un conocimiento profundo tanto de la arquitectura hardware como de los compiladores y runtime de GPU, y aquí es donde entran empresas de tecnología como Q2BSTUDIO.

Q2BSTUDIO ofrece aplicaciones a medida que integran soluciones de alto rendimiento con la nube y la inteligencia artificial. Nuestro equipo entiende que la optimización no termina en el modelo, sino que debe llegar hasta el último kernel. Por eso, para clientes que trabajan con inferencia masiva o entrenamiento distribuido, desarrollamos capas de software personalizadas que implementan estrategias de desagregación similares a las de Tessera, adaptadas a su hardware específico. Ya sea mediante agentes IA que gestionan el pipeline de ejecución o mediante sistemas de ia para empresas que se despliegan sobre clusters híbridos, nuestro objetivo es que cada ciclo de GPU cuente.

La integración con servicios cloud también es clave. Muchos de nuestros proyectos combinan la potencia de las GPUs locales con la elasticidad de AWS o Azure, utilizando servicios cloud aws y azure para picos de demanda. En esos escenarios, la desagregación a nivel de kernel puede reasignar cargas entre instancias de GPU de diferentes tipos (por ejemplo, A100 y T4) según el perfil de cada kernel, reduciendo costes de infraestructura. Además, empleamos herramientas de servicios inteligencia de negocio como Power BI para monitorizar en tiempo real la utilización de cada GPU y generar alertas cuando la asignación no es óptima. Esta visibilidad permite a los equipos de datos tomar decisiones informadas sobre cuándo escalar o cambiar de instancia.

No obstante, la desagregación a nivel de kernel no es una panacea. Requiere técnicas avanzadas de ciberseguridad, ya que mover kernels entre GPUs implica transferir datos sensibles que deben protegerse. Las empresas que adoptan estos sistemas deben contar con políticas de ciberseguridad sólidas, tanto a nivel de red como de memoria compartida. Q2BSTUDIO incluye en sus soluciones módulos de seguridad que cifran la comunicación entre GPUs y verifican la integridad de los kernels, alineándose con normativas como GDPR. Asimismo, la complejidad de las dependencias hace necesario un seguimiento riguroso de los tiempos de ejecución; por eso combinamos la inteligencia artificial con dashboards de power bi para detectar patrones anómalos y prevenir cuellos de botella.

En el horizonte, la evolución de la inteligencia artificial generativa y los agentes autónomos demandará cada vez más eficiencia en la inferencia. Los sistemas que hoy son investigación, como Tessera, mañana serán estándar en las infraestructuras de producción. Por eso, las empresas que invierten ahora en software a medida y en la optimización de sus clusters heterogéneos estarán mejor posicionadas para escalar sus aplicaciones de IA sin disparar los costes. Desde Q2BSTUDIO, acompañamos a nuestros clientes en ese camino, diseñando arquitecturas que combinan el mejor hardware disponible con un software inteligente, capaz de exprimir hasta el último recurso de cada GPU.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.