La interacció amb models de llenguatge de gran escala (LLM) ha evolucionat més enllà del xat conversacional. Eines com Thinkink representen un salt qualitatiu en permetre que l’usuari escrigui i dibuixi a mà en un llenç compartit, rebent respostes generades per IA en forma de text i esbossos similars a tinta. Aquest enfocament 'ink-native' transforma la ideació creativa i la resolució de problemes, combinant l’expressivitat analògica amb la potència computacional. Tanmateix, darrere d’aquesta experiència fluida hi ha desafiaments tècnics i de disseny que qualsevol empresa que vulgui adoptar solucions similars ha de considerar. A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, explorem com aquests conceptes es poden integrar en aplicacions empresarials reals, aprofitant la nostra experiència en aplicacions a mida, intel·ligència artificial, ciberseguretat i cloud computing.
Thinkink utilitza un arbre semàntic per interpretar el contingut manuscrit, reduint ambigüitats i permetent que l’LLM generi respostes contextualment rellevants. Aquesta arquitectura és similar als pipelines de processament de llenguatge natural que implementem en projectes d’IA per a clients que necessiten extreure coneixement de documents no estructurats. La màquina d’estats a la interfície d’usuari ofereix un control explícit sobre el flux d’interacció, evitant que el model prengui decisions no desitjades. Aquest patró és especialment útil en entorns empresarials on la predictibilitat i la seguretat són crítiques. Per exemple, en un sistema d’anàlisi financer basat en Power BI, un usuari podria dibuixar un gràfic aproximat i l’LLM el convertiria en una consulta visual, sempre supervisat per regles de negoci. A Q2BSTUDIO integrem aquestes capacitats en plataformes cloud com AWS o Azure, garantint escalabilitat i compliment normatiu.
La fase formativa de l’estudi de Thinkink va revelar que els professionals valoren la llibertat del dibuix a mà, però necessiten eines que no interrompin el seu flux cognitiu. Per a una empresa que desenvolupa programari de ciberseguretat, per exemple, un analista podria esbossar un diagrama de xarxa i l’LLM suggeriria vulnerabilitats potencials. Aquest tipus d’interacció multimodal redueix la fricció entre la idea i la seva implementació. Des de la perspectiva de negoci, incorporar capacitats d’escriptura i dibuix en aplicacions existents requereix una arquitectura modular que suporti APIs d’LLM, motors de reconeixement d’escriptura (com MyScript o Azure Cognitive Services) i un motor de renderitzat de tinta digital. A Q2BSTUDIO dissenyem solucions on la tinta digital es converteix en un input més per als algoritmes d’IA, ja sigui per generar informes automàtics o per entrenar models de detecció d’anomalies en temps real.
L’estudi de diagnòstic amb sis participants va identificar desafiaments d’usabilitat i d’interacció humà-LLM, com la manca de claredat en les intencions del model o la dificultat per corregir respostes no desitjades. Aquests problemes es mitiguen amb una interfície d’usuari que permet editar, esborrar o redirigir parts del diàleg visual. En el context d’una plataforma d’automatització de processos, un empleat podria dibuixar un flux de treball i l’LLM proposaria passos addicionals basats en dades històriques de l’empresa. La retroalimentació immediata i la capacitat de refinar l’entrada mitjançant gestos de tinta (tatxar, subratllar) milloren la precisió del sistema. Per aconseguir-ho, és necessari integrar serveis cloud d’alta disponibilitat i models d’IA entrenats amb dades específiques del domini. A Q2BSTUDIO oferim consultoria per seleccionar la combinació òptima d’AWS/Azure, assegurant que els costos d’inferència siguin previsibles i que les dades sensibles romanguin xifrades.
L’estudi final amb deu participants va demostrar que Thinkink s’integra naturalment en pràctiques d’ideació, des del disseny de productes fins a la planificació estratègica. Els usuaris no només rebien respostes textuals, sinó que l’LLM podia completar esbossos o suggerir variacions gràfiques. Aquesta capacitat obre portes a aplicacions com la cocreació d’interfícies d’usuari, on un dissenyador dibuixa un wireframe i la IA genera el codi corresponent. Per a una empresa que desenvolupa aplicacions multiplataforma, això accelera el prototipat i redueix els cicles de revisió. A més, la naturalesa col·laborativa del llenç compartit permet que diversos usuaris treballin simultàniament, amb l’LLM actuant com a moderador o assistent. A Q2BSTUDIO implementem sistemes de col·laboració en temps real sobre cloud, amb versionat de canvis i control d’accés basat en rols, complint amb els més alts estàndards de ciberseguretat.
Les implicacions de disseny extretes de l’estudi són rellevants per a qualsevol organització que busqui humanitzar la interacció amb la IA. Una de les conclusions clau és que la interfície ha de preservar la sensació d’escriptura natural, però oferir mecanismes per corregir errors d’interpretació. En l’àmbit de Business Intelligence, això permet que els executius dibuixin tendències aproximades i rebin anàlisis detallats sense dependre d’intermediaris tècnics. La integració amb Power BI, per exemple, podria convertir gargots en gràfics interactius que després es visualitzen en dashboards. A Q2BSTUDIO hem desenvolupat eines que connecten aquestes capacitats amb fonts de dades empresarials, assegurant que la IA respecti les regles de negoci i les polítiques de govern de la dada.
Des d’un punt de vista tècnic, Thinkink utilitza un algoritme d’arbre semàntic que prioritza la interpretació del context sobre el reconeixement exacte de caràcters. Això és especialment útil quan l’usuari barreja text, diagrames i símbols. Per a una empresa d’automatització, un enginyer podria dibuixar un diagrama de flux amb notes manuscrites, i el sistema el transformaria en un script executable. La màquina d’estats, per la seva banda, garanteix que l’LLM no salti de tasca sense confirmació de l’usuari. Aquest enfocament és transferible a entorns industrials on la supervisió humana és obligatòria, com en sistemes de control de qualitat o en processos de ciberseguretat que requereixen aprovació abans d’executar canvis. A Q2BSTUDIO dissenyem interfícies adaptatives que equilibren l’autonomia del model amb el control humà, utilitzant serveis cloud d’AWS Step Functions o Azure Logic Apps per orquestrar els fluxos.
L’adopció d’interfícies ink-native no està exempta de desafiaments. El reconeixement d’escriptura a mà segueix sent una àrea activa de recerca, i els models de llenguatge poden al·lucinar si el context és ambigu. Per tant, és fonamental implementar capes de validació i depuració. En l’àmbit de les aplicacions a mida, és possible configurar el sistema perquè l’LLM sol·liciti aclariments quan l’entrada sigui poc clara, reduint així els errors. A més, la gestió de la privacitat és crítica: els dibuixos i textos manuscrits poden contenir informació sensible, per la qual cosa el processament s’ha de realitzar en infraestructura cloud amb xifrat d’extrem a extrem. A Q2BSTUDIO assessorem els nostres clients sobre les millors pràctiques de seguretat, incloent auditories periòdiques dels models i de les dades emmagatzemades.
Mirant cap al futur, la combinació de tinta digital i LLM té el potencial de democratitzar l’accés a la intel·ligència artificial. Qualsevol persona que pugui dibuixar o escriure a mà podrà interactuar amb sistemes complexos sense necessitat d’aprendre llenguatges de programació o interfícies rígides. Per a les empreses, això significa que empleats de tots els nivells poden contribuir a la innovació, des del disseny de productes fins a la millora de processos. A Q2BSTUDIO, estem compromesos amb la creació de programari que potenciï la creativitat humana, integrant IA, cloud i ciberseguretat de manera transparent. Si la teva organització està explorant com incorporar aquest tipus d’interacció en les seves eines, et convidem a contactar-nos. El nostre equip d’experts en desenvolupament d’aplicacions a mida, intel·ligència artificial i cloud computing pot ajudar-te a materialitzar aquestes idees.





