Automatitza vistes d'AWS Glue Data Catalog amb SDK per a data mesh

Aprèn a programar vistes ATHENA i SPARK a AWS Glue usant SDK, amb rols definidors entre comptes per a arquitectures data mesh.

sábado, 25 de julio de 2026 • 4 min de lectura • Equip Q2BSTUDIO

Crea vistas multidioma con roles definidores entre cuentas

En l'era de la governança de dades distribuïda, les arquitectures data mesh s'han convertit en un estàndard per a organitzacions que necessiten escalar l'accés a la informació sense perdre control centralitzat. AWS Glue Data Catalog ofereix vistes multidioma (ATHENA i SPARK) que permeten compartir subconjunts de dades entre comptes utilitzant rols definidors IAM, una capacitat clau per automatitzar pipelines de dades en entorns multicompte. Aquest article explora com el SDK d'AWS permet crear i actualitzar aquestes vistes de forma programàtica, habilitant una automatització robusta que accelera el lliurament de dades analítiques en arquitectures data mesh.

La vista de catàleg no exposa les taules base subjacents; en lloc d'això, actua com una capa d'abstracció gestionada per Lake Formation. El rol definidor, que pot residir en un compte diferent, posseeix els permisos SELECT complets sobre les taules originals, i quan es consulta la vista, el Data Catalog assumeix aquest rol per gestionar l'accés. Això permet als productors de dades compartir informació sense revelar les taules base, un requisit fonamental en models d'autoservei on cada equip manté els seus propis actius. Amb la recent incorporació de suport SDK per al dialecte ATHENA, ara és possible crear simultàniament els dialectes SPARK i ATHENA mitjançant una única crida a CreateTable() o UpdateTable().

Per implementar aquesta automatització, es requereix una connexió de validació d'AWS Glue de tipus VIEW_VALIDATION_ATHENA, que utilitza un workgroup i un data source d'Athena que apunti al catàleg central. Aquesta connexió és un pas únic per parell compte productor-compte central. Després, des del compte productor, el rol definidor executa l'API CreateTable() amb una definició JSON que inclou tant el dialecte SPARK (sense validació) com l'ATHENA (amb validació asíncrona). El camp SubObjects llista els ARN de les taules base al compte central, i la vista es crea en una base de dades de resource link que referencia el catàleg compartit.

Des de la perspectiva empresarial, aquest flux redueix la fricció en l'adopció de data mesh. Els equips de producte poden gestionar els seus pipelines CI/CD als seus propis comptes usant rols IAM específics, mentre que la governança central manté el control sobre permisos i catàlegs. Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, aplica aquestes capacitats en projectes d'aplicacions a mida on la integració de dades és crítica. La combinació de vistes multidioma amb agents d'IA i dashboards de Power BI permet construir solucions analítiques que s'actualitzen en temps real sense exposar dades sensibles.

L'automatització mitjançant SDK no es limita a la creació inicial. Amb UpdateTable() i l'acció 'REPLACE', és possible modificar la definició SQL d'ambdós dialectes de forma simultània, mantenint la consistència i evitant que una vista quedi en estat no consultable. A més, les vistes es poden compartir mitjançant etiquetes de Lake Formation (LF-Tags) a comptes consumidores, que hi accedeixen a través de resource links. Aquest enfocament és ideal per a entorns on la ciberseguretat i el compliment normatiu són prioritaris, ja que l'accés a les dades subjacents està estrictament controlat pel rol definidor i les polítiques de Lake Formation.

A la pràctica, una implementació típica comença amb la configuració d'un catàleg central en un compte de governança, on es defineixen les taules base (per exemple, transaccions bancàries) i s'atorguen permisos al rol definidor del compte productor mitjançant Lake Formation. Després, des del compte productor es crea el resource link i s'executa un script Python (o PySpark a Glue Studio) amb les configuracions adequades: versió de Glue 5.1, workers >=4, i els paràmetres --datalake-formats=iceberg i --enable-lakeformation-fine-grained-access=true. L'script utilitza Boto3 per cridar create_table amb la vista definida, i el resultat es verifica amb get-table incloent --include-status-details.

Un dels reptes habituals és l'actualització de vistes existents que només tenen dialecte SPARK. Amb el suport SDK, es pot afegir el dialecte ATHENA usant UpdateTable() amb ViewUpdateAction='ADD', proporcionant la connexió de validació corresponent. Si es vol canviar la lògica de la vista, s'empra 'REPLACE' per reemplaçar ambdues definicions. Aquesta flexibilitat permet que els equips de cloud AWS/Azure mantinguin un cicle de vida automatitzat dels actius de dades, reduint la intervenció manual i els errors de configuració.

La integració amb IA es potencia al poder exposar vistes netes i governades a motors d'aprenentatge automàtic sense necessitat de duplicar dades. Per exemple, un equip de ciència de dades pot entrenar models usant vistes que uneixen taules de diferents departaments, amb permisos granulars i sense conèixer la ubicació física de les dades. De manera similar, els dashboards de Power BI poden consultar aquestes vistes des d'Athena, obtenint resultats actualitzats sense comprometre la seguretat. Q2BSTUDIO ajuda a les organitzacions a dissenyar aquestes arquitectures, combinant la seva expertesa en BI/Power BI i desenvolupament de programari a mida per crear solucions que escalen amb el negoci.

En definitiva, l'automatització de vistes d'AWS Glue Data Catalog mitjançant SDK representa un avenç significatiu per a les arquitectures data mesh. Permet als productors gestionar els seus actius de dades de manera autònoma, mentre que la governança central manté el control. La possibilitat de crear i actualitzar dialectes SPARK i ATHENA de forma programàtica, unida a la integració amb Lake Formation, simplifica l'adopció de models d'autoservei sense sacrificar la seguretat. Per a les empreses que busquen modernitzar la seva plataforma analítica, aquesta capacitat és un habilitador clau que, juntament amb els serveis de Q2BSTUDIO en automatització de processos i ciberseguretat, estableix les bases per a una governança de dades àgil i segura.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.