Tessera: Desbloquejant GPUs Heterogènies mitjançant Desagregació a Nivell de Kernel

Descobreix com Tessera desagrega kernels en GPUs heterogènies per accelerar la inferència de models grans fins a 2.3x, superant solucions tradicionals.

sábado, 11 de julio de 2026 • 5 min de lectura • Equip Q2BSTUDIO

Desagregació de kernels per a inferència eficient

L'auge dels models d'intel·ligència artificial ha portat les empreses a buscar infraestructures cada vegada més potents i flexibles. No obstant això, la varietat de GPUs disponibles al mercat —des de solucions d'alt rendiment fins a opcions més econòmiques— planteja un desafiament: com aprofitar al màxim un clúster heterogeni sense perdre eficiència ni disparar els costos. Tradicionalment, les estratègies de desagregació han operat a nivell d' aplicació o de capa completa, assignant càrregues de treball senceres a un tipus de GPU. Però aquesta granularitat gruixuda desperta oportunitats d'optimització, ja que dins d'un mateix model d'inferència conviuen kernels amb perfils de recursos molt diferents. Un nou enfocament, materialitzat en sistemes com Tessera, proposa trencar aquesta barrera i portar la desagregació al nivell de kernel, és a dir, al fragment més petit de còmput que s'executa a la GPU. Aquesta innovació promet transformar la manera com les organitzacions despleguen intel·ligència artificial en entorns heterogenis.

La idea central és senzilla però potent: si cada kernel dins d'una aplicació demana una quantitat específica de memòria, ample de banda i capacitat de còmput, llavors el lògic és aparellar-lo amb la GPU que millor s'adapti a aquestes necessitats. Per exemple, un kernel amb alta demanda de memòria pot executar-se en una GPU amb major VRAM, mentre que un altre kernel amb operacions matricials intensives pot beneficiar-se d'una GPU amb més nuclis CUDA. Fins ara, les solucions existents requerien que el model complet encaixés en una sola GPU, o bé fragmentaven la càrrega a nivell de capes o blocs, la qual cosa introduïa complexitats de sincronització i dependències difícils de manejar. Tessera, en canvi, extreu les dependències entre kernels directament del codi PTX, un llenguatge de baix nivell de NVIDIA, i garanteix la correcció de l' execució distribuïda sense necessitat de modificar el model original.

Per què això és rellevant per al món empresarial? Perquè la inferència de models grans és un dels colls d'ampolla més costosos en l'adopció d'IA. Una empresa que executa un assistent conversacional o un sistema de recomanació necessita minimitzar la latència i maximitzar el throughput, però també controlar la despesa en maquinari. Amb Tessera, un parell de GPUs heterogènies —una de gamma alta i una altra de més modesta— pot superar el rendiment de dues GPUs homogènies d'alta gamma, reduint simultàniament la inversió. Això obre la porta al fet que companyies de qualsevol mida accedeixin a capacitats d'intel·ligència artificial que abans només estaven a l'abast de gegants tecnològics. A més, el sistema incorpora un model d' execució en pipeline que superposa la comunicació amb el còmput, minimitzant els temps morts i augmentant l' eficiència global.

Darrere d'aquesta capacitat tècnica hi ha una lliçó més àmplia: l'especialització de maquinari no és suficient si no va acompanyada d'un programari a mesura que sàpiga orquestrar els recursos de forma intel·ligent. Les empreses que vulguin aprofitar les GPU heterogènies —ja sigui als seus centres de dades locals o mitjançant serveis cloud aws i azure— necessitaran solucions de middleware que adaptin dinàmicament l'assignació de tasques. Tessera demostra que és possible mitjançant una combinació d'anàlisi offline (per conèixer els requisits de cada kernel) i adaptació online (per reaccionar a canvis en la càrrega o en la disponibilitat de GPUs). Aquest tipus de desenvolupament requereix un coneixement profund tant de l' arquitectura maquinari com dels compiladors i runtime de GPU, i aquí és on entren empreses de tecnologia com Q2BSTUDIO.

Q2BSTUDIO ofereix aplicacions a mesura que integren solucions d'alt rendiment amb el núvol i la intel·ligència artificial. El nostre equip entén que l'optimització no acaba en el model, sinó que ha d'arribar fins a l'últim kernel. Per això, per a clients que treballen amb inferència massiva o entrenament distribuït, desenvolupem capes de programari personalitzades que implementen estratègies de desagregació similars a les de Tessera, adaptades al seu maquinari específic. Ja sigui mitjançant agents IA que gestionen el pipeline d'execució o mitjançant sistemes de ia per a empreses que es despleguen sobre clusters híbrids, el nostre objectiu és que cada cicle de GPU compti.

La integració amb serveis cloud també és clau. Molts dels nostres projectes combinen la potència de les GPUs locals amb l'elasticitat d'AWS o Azure, utilitzant serveis cloud aws i azure per a pics de demanda. En aquests escenaris, la desagregació a nivell de kernel pot reassignar càrregues entre instàncies de GPU de diferents tipus (per exemple, A100 i T4) segons el perfil de cada kernel, reduint costos d'infraestructura. A més, fem servir eines de serveis intel·ligència de negoci com Power BI per monitoritzar en temps real la utilització de cada GPU i generar alertes quan l'assignació no és òptima. Aquesta visibilitat permet als equips de dades prendre decisions informades sobre quan escalar o canviar d' instància.

No obstant això, la desagregació a nivell de kernel no és una panacea. Requereix tècniques avançades de ciberseguretat, ja que moure kernels entre GPUs implica transferir dades sensibles que s'han de protegir. Les empreses que adopten aquests sistemes han de comptar amb polítiques de ciberseguretat sòlides, tant a nivell de xarxa com de memòria compartida. Q2BSTUDIO inclou en les seves solucions mòduls de seguretat que xifren la comunicació entre GPUs i verifiquen la integritat dels kernels, alineant-se amb normatives com GDPR. Així mateix, la complexitat de les dependències fa necessari un seguiment rigorós dels temps d' execució; per això combinem la intel·ligència artificial amb dashboards de power bi per detectar patrons anòmals i prevenir colls d'ampolla.

En l'horitzó, l'evolució de la intel·ligència artificial generativa i els agents autònoms demandarà cada vegada més eficiència en la inferència. Els sistemes que avui són recerca, com Tessera, demà seran estàndard en les infraestructures de producció. Per això, les empreses que inverteixen ara en programari a mida i en l'optimització dels seus clusters heterogenis estaran més ben posicionades per escalar les seves aplicacions d'IA sense disparar els costos. Des de Q2BSTUDIO, acompanyem els nostres clients en aquest camí, dissenyant arquitectures que combinen el millor maquinari disponible amb un programari intel·ligent, capaç d'exprimir fins a l'últim recurs de cada GPU.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.