Com instal·lar i configurar el NVIDIA GPU Operator a Kubernetes

Aprèn a instal·lar i configurar el NVIDIA GPU Operator a Kubernetes. Guia pas a pas amb requisits previs, instal·lació amb Helm, validació i resolució de

viernes, 24 de julio de 2026 • 5 min de lectura • Equip Q2BSTUDIO

Guía completa para desplegar el GPU Operator en Kubernetes

La integració de GPUs a Kubernetes ha passat de ser un luxe tècnic a una necessitat estratègica per a empreses que treballen amb intel·ligència artificial, anàlisi de dades i simulacions computacionals. Tanmateix, instal·lar i configurar el NVIDIA GPU Operator no és tan simple com executar una comanda Helm. Requereix comprendre l'arquitectura subjacent, preparar els nodes adequadament i alinear l'operativa amb els objectius de negoci. A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, sabem que la clau està a automatitzar sense perdre el control. Per això, aquest article et guia pas a pas perquè el teu clúster Kubernetes pugui aprofitar al màxim el potencial de les GPUs, tot des d'una perspectiva tècnica i empresarial.

Abans de començar, és fonamental entendre que el NVIDIA GPU Operator no substitueix el scheduler de Kubernetes, sinó que prepara el node perquè aquest pugui veure i assignar les GPUs. La pila de programari consta de diverses capes: el driver NVIDIA, el container toolkit, el device plugin, el monitor DCGM i components de descobriment. Cada capa depèn de la inferior, per tant qualsevol problema s'ha de solucionar des de la base: el maquinari i el driver. Per això, la primera comprovació és que la GPU sigui visible al sistema operatiu amb lspci. Sense això, cap operador pot ajudar.

El suport de plataforma és un altre punt crític. No totes les combinacions de Linux, kernel, Kubernetes i runtime estan validades. Abans d'instal·lar, verifica que la teva versió de Kubernetes (per exemple, 1.32 a 1.36 per a la sèrie 26.3), el sistema operatiu i el runtime (containerd 1.7+ o CRI-O) estiguin a la matriu de suport de NVIDIA. També cal comprovar que els headers del kernel estiguin disponibles per compilar el mòdul del driver. Si el node té un driver preinstal·lat, hauràs de decidir si l'operador el gestiona o no. A Q2BSTUDIO recomanem utilitzar el model gestionat per l'operador en la majoria dels casos, ja que simplifica el cicle de vida i les actualitzacions, però sempre avaluant l'entorn concret de cada client.

La preparació del node inclou verificar que no hi hagi conflictes amb el mòdul nouveau, deshabilitar Secure Boot si el driver es gestiona des de l'operador, i assegurar que el node tingui accés als repositoris de paquets i als registres d'imatges. Un error comú és ignorar la política d'actualització del kernel: si el kernel s'actualitza automàticament, el driver pot deixar de carregar-se. Per això, en entorns productius és millor congelar la versió del kernel o utilitzar un model de driver precompilat.

Un cop el node està llest, la instal·lació del GPU Operator es realitza mitjançant Helm, usant un fitxer de valors personalitzat. És important fixar la versió del chart per garantir reproducibilitat. La configuració bàsica inclou habilitar el driver, el toolkit amb CDI (interfície de dispositius de contenidor) activat per defecte des de la versió 25.10, i el device plugin. No cal establir runtimeClassName: nvidia als pods, ja que CDI ho gestiona de forma transparent. Només cal sol·licitar nvidia.com/gpu: 1 als límits de recursos.

Després de la instal·lació, la validació és obligatòria. Comprova que els DaemonSets estiguin en estat Running, que el ClusterPolicy mostri ready i que els nodes tinguin recursos nvidia.com/gpu assignables. Executa un pod de prova amb un vector add de CUDA per verificar que el kernel funciona. També pots executar nvidia-smi dins d'un contenidor. A Q2BSTUDIO hem vist que molts equips salten aquesta validació i després troben problemes difícils de diagnosticar. Establir una línia base documentada (versions, logs, resultats) és clau per a futures actualitzacions.

La resolució de problemes ha de seguir un enfocament ascendent. Si un pod no veu la GPU, no comencis per l'aplicació. Revisa primer el maquinari, després el driver (logs del pod driver, dmesg), després el toolkit i el device plugin. Una causa comuna és que el device plugin no s'hagi registrat correctament a kubelet, o que el pod sol·liciti més GPUs de les disponibles. També verifica que no hi hagi taints o affinity que impedeixin l'assignació. Si el problema persisteix, utilitza l'eina must-gather de NVIDIA per recopilar informació.

Des d'una perspectiva empresarial, el GPU Operator permet escalar càrregues de treball d'IA i machine learning de forma eficient, però requereix una governança adequada. Les actualitzacions s'han de planificar acuradament: primer en un pool de nodes no productiu, després rodant. L'operador suporta actualitzacions dins de la mateixa versió major i a la següent, però no salts de diverses versions. El controlador d'actualització de drivers està activat per defecte i és la via recomanada per a drivers gestionats. Per a drivers instal·lats al host, l'actualització s'ha de fer fora de l'operador.

A Q2BSTUDIO oferim serveis de programari a mida per integrar solucions de GPU computing a la teva infraestructura cloud, ja sigui a AWS o Azure. A més, les nostres capacitats en IA ens permeten dissenyar agents intel·ligents que aprofiten GPUs per a inferència en temps real. La ciberseguretat també és clau: protegim els pipelines de dades i els models contra accessos no autoritzats. I si necessites visualitzar el rendiment de les teves GPUs, les nostres solucions de Business Intelligence amb Power BI t'ofereixen dashboards en temps real. Tot recolzat per un equip expert en automatització i cloud natiu.

En resum, instal·lar i configurar el NVIDIA GPU Operator a Kubernetes és un procés que exigeix preparació, coneixement de la pila de programari i disciplina operativa. No és un projecte d'un dia, però amb la guia adequada i el suport de partners com Q2BSTUDIO, la teva organització pot desbloquejar tot el potencial de la computació accelerada. El resultat és una plataforma robusta, escalable i preparada per als reptes de la intel·ligència artificial i l'anàlisi de dades modern.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.