La implementació de sistemes de recuperació augmentada per generació (RAG) en producció requereix més que un diagrama d'arquitectura. Quan es combina amb Kubernetes, l'orquestració de microserveis, models de llenguatge, bases de dades vectorials i emmagatzematge persistent es converteix en un exercici d'enginyeria de programari avançat. En aquest article explorem com desplegar el NVIDIA RAG Blueprint sobre Kubernetes utilitzant Helm, mantenint un enfocament empresarial i amb recomanacions pràctiques basades en la nostra experiència a Q2BSTUDIO, empresa especialitzada en desenvolupament d'aplicacions a mida i solucions d'intel·ligència artificial.
El NVIDIA RAG Blueprint és una plataforma de referència que integra serveis d'ingesta, servidors RAG, microserveis NIM, emmagatzematges vectorials com Elasticsearch o Milvus, i emmagatzematge d'objectes. El seu desplegament amb Helm permet reproducibilitat, però exigeix decisions tècniques prèvies. L'arquitectura separa dos fluxos clars: la ingesta de documents (asíncrona, intensiva en emmagatzematge) i la consulta d'usuaris (sensible a latència, amb recuperació i generació). Entendre aquesta dualitat és crític per dimensionar recursos i planificar l'operació.
Abans de començar, cal verificar que el clúster Kubernetes compleix els requisits: GPU compatibles (H100, B200, RTX PRO 6000), drivers NVIDIA 560+, CUDA 12.9+, Helm 3, i un StorageClass funcional. Q2BSTUDIO recomana fer una validació prèvia amb ordres com kubectl get nodes -L nvidia.com/gpu.present per assegurar que els nodes GPU estan correctament etiquetats. La instal·lació del GPU Operator i del NIM Operator són passos obligatoris, i s'han de fer amb versions fixades per evitar regressions. Per exemple, utilitzem gpu-operator v26.3.3 i nim-operator 3.1.1.
Un cop preparat el clúster, creem un namespace dedicat (per exemple, rag) i els secrets necessaris per a autenticació amb NGC i altres serveis. És fonamental centralitzar la gestió de credencials, idealment amb un gestor de secrets extern. El fitxer de valors de Helm ha de ser mínim: només canvis deliberats com classes d'emmagatzematge, referències a secrets existents i configuracions de persistència. A Q2BSTUDIO hem vist que un overlay petit facilita les actualitzacions i redueix errors.
El desplegament amb helm upgrade --install pot trigar entre 60 i 70 minuts en la primera execució degut a la descàrrega de models i creació de memòries cau NIM. Durant aquest temps és normal que els pods romanguin en estat d'inicialització. Recomanem monitoritzar els recursos NIMCache i NIMService, no només els pods. Un cop completat, s'ha de validar la salut dels serveis per separat: primer el servidor RAG (port 8081) i després el servidor d'ingesta (port 8082).
L'elecció de l'emmagatzematge vectorial és estratègica. Elasticsearch és l'opció per defecte i s'integra mitjançant ECK (Elastic Cloud on Kubernetes). Milvus és alternativa per a equips amb experiència en cerca vectorial pura. El canvi requereix reingerir documents, ja que no hi ha migració automàtica. A més, la cerca híbrida (densa + dispersa) i el reranking s'han d'activar després de validar el flux base. Per exemple, amb pesos 0.6 dens i 0.4 dispers.
La seguretat s'ha de considerar des del disseny. Els serveis interns (NIM, Redis, Elasticsearch, SeaweedFS) no s'han d'exposar a xarxes no fiables. Es recomana utilitzar serveis ClusterIP, polítiques de xarxa i passarel·les API. Les metadades dels documents permeten filtres d'autorització, però mai han de ser l'única barrera. Q2BSTUDIO integra en els seus projectes solucions de ciberseguretat per protegir l'accés a dades sensibles.
El dimensionament d'emmagatzematge és un altre punt crític. Les memòries cau de models NIM consumeixen centenars de GB; els índexs vectorials i les dades d'objectes requereixen discs SSD de baixa latència. Planifiqueu almenys 200 GB per node GPU, i separeu classes d'emmagatzematge segons el patró d'accés. En entorns cloud, utilitzant serveis cloud AWS/Azure es pot aprofitar emmagatzematge gestionat com EBS o Azure Disk amb diferents rendiments.
La monitorització i observabilitat són essencials per a un entorn productiu. El Blueprint inclou OpenTelemetry, Zipkin, Prometheus i Grafana. Recomanem habilitar el traçat distribuït per correlacionar latències entre recuperació, reranking i generació. També és útil recollir mètriques d'ús de GPU, taxes d'encert de memòria cau i temps d'ingesta. Q2BSTUDIO empra solucions de BI/Power BI per construir dashboards operatius que permetin prendre decisions basades en dades.
L'avaluació ha d'anar més enllà de l'estat dels pods. Construïu un conjunt de proves amb preguntes reals, incloent identificadors exactes, paràfrasis i consultes que hagin de retornar buit. Mesureu precisió de respostes, rellevància del context i fidelitat (groundedness). El flux d'avaluació de NVIDIA (Ragas) proporciona mètriques estandarditzades. Guardeu la configuració i els resultats per detectar regressions després de canvis de model o esquema.
La MIG (Multi-Instance GPU) permet consolidar càrregues de treball en menys GPUs H100, passant de 8 a 5 GPUs. Tanmateix, no és adequada per a ingesta massiva. Si la vostra prioritat és la ingesta, considereu un clúster separat o finestres de procés dedicades. La configuració MIG s'ha de fer mitjançant el GPU Operator amb estratègia mixta, i validar que cada NIM suporta el perfil de memòria assignat.
Finalment, l'estratègia d'actualització i rollback ha de contemplar tant Helm com les dades. Els charts de Helm permeten rollback de configuració, però no reverteixen migracions d'esquemes ni canvis en models d'embeddings. Per això és vital fer còpies de seguretat dels índexs vectorials i de les dades d'objectes abans de qualsevol actualització major. Q2BSTUDIO aplica pràctiques d'integració contínua i desplegament automatitzat en els seus projectes d'automatització de processos per garantir transicions segures.
En resum, desplegar el NVIDIA RAG Blueprint a Kubernetes amb Helm és una tasca complexa que requereix planificació en múltiples capes: infraestructura, emmagatzematge, seguretat, model de dades i avaluació. Un enfocament metòdic, amb validacions separades d'ingesta i consulta, i amb el suport d'un equip expert com Q2BSTUDIO, permet construir una base sòlida per a aplicacions d'intel·ligència artificial generativa. Si la vostra organització està explorant aquests casos d'ús, no dubteu a contactar-nos per dissenyar una solució adaptada a les vostres necessitats.




