En l'ecosistema actual de desenvolupament de programari, la necessitat de processar àudio de forma eficient i privada s'ha convertit en un requisit freqüent, especialment en entorns on les dades sensibles no poden sortir de la infraestructura local. Fa uns mesos, vam afrontar el repte de transcriure llargues reunions gravades sense dependre de serveis al núvol que poguessin comprometre la confidencialitat o generar costos recurrents elevats. La solució va ser construir un pipeline completament local utilitzant Node.js i Whisper, el model de reconeixement de veu d'OpenAI optimitzat per executar-se sense connexió. Aquest enfocament no només ens va permetre estalviar entre 50 i 100 dòlars al mes en APIs de tercers, sinó que també ens va donar control absolut sobre les dades. A Q2BSTUDIO, com a empresa especialitzada en el desenvolupament de programari a mida i solucions tecnològiques, creiem que aquesta arquitectura es pot replicar i adaptar a múltiples escenaris empresarials.
El pipeline s'estructura en tres fases principals: ingesta i normalització de l'àudio, transcripció amb Whisper i post-processament per generar subtítols SRT i emmagatzemar els resultats en una base de dades local. Tot corre en Node.js, utilitzant biblioteques lleugeres i processos fill per invocar eines externes com FFmpeg i whisper.cpp. Aquesta separació permet que cada etapa sigui reemplaçable o escalable segons les necessitats del projecte. Per exemple, si el volum d'àudio és molt alt, es pot paral·lelitzar el processament amb cues de treball o fins i tot integrar agents d'IA que actuïn sobre les transcripcions per extreure conclusions o generar resums automàtics.
La primera etapa normalitza l'àudio a 16 kHz, mono, format WAV amb 16 bits de profunditat, que és el format que Whisper espera per obtenir els millors resultats. Utilitzem FFmpeg des de Node.js mitjançant la biblioteca execa, cosa que ens dona un control fi sobre els paràmetres de conversió. Aquest pas és crucial perquè fitxers de baixa qualitat o amb formats comprimits (com MP3 o AAC) poden degradar significativament la precisió de la transcripció. A més, la normalització garanteix que el model rebi senyals coherents independentment de l'origen de l'àudio: micròfon de portàtil, gravació de Zoom o fitxer de podcast.
La segona etapa executa el binari de whisper.cpp com un procés fill. Whisper.cpp és una implementació en C++ del model Whisper, optimitzada per CPUs i GPUs sense necessitat de biblioteques pesades com PyTorch. Seleccionem el model 'base' com a punt òptim entre velocitat i precisió. En proves internes amb un Ryzen 5 5600X i una RTX 3060, el model base transcriu un minut d'àudio en uns 7,8 segons, amb una taxa d'error de paraula (WER) del 6,7%, més que acceptable per a aplicacions de negoci. Si es necessita més precisió (per exemple, per a transcripcions legals), es pot escalar a models 'medium' o 'large' a costa de més temps de processament i consum de VRAM. Aquesta flexibilitat és clau quan s'integra en sistemes de ciberseguretat, on cada paraula pot ser rellevant, o en solucions de BI que extreuen mètriques de converses d'atenció al client.
La tercera fase guarda la transcripció en una base de dades SQLite usant la biblioteca better-sqlite3, que ofereix persistència sense configuració i un rendiment excel·lent per a volums moderats. Emmagatzemem el text complet, la durada de l'àudio, el model utilitzat, el contingut SRT per a subtítols i la data de creació. Amb un índex descendent per data, podem fer cerques ràpides sobre el contingut textual, cosa que permet, per exemple, localitzar totes les reunions on es va mencionar un terme clau com 'pressupost' o 'contracte'. Aquesta funcionalitat es pot estendre amb eines de Business Intelligence (BI) com Power BI per generar dashboards de seguiment de temes recurrents. A Q2BSTUDIO oferim serveis de BI que connecten bases de dades locals o al núvol amb visualitzacions interactives, i aquest tipus de pipeline és un excel·lent punt de partida per alimentar aquests quadres de comandament amb dades d'àudio transcrit.
Un dels majors beneficis de mantenir tot el processament en local és la privacitat. Les dades mai surten de la xarxa de l'empresa, cosa que compleix amb requisits estrictes de ciberseguretat i normatives com el GDPR. Per a organitzacions que manegen informació sensible de clients, com en el sector legal o sanitari, aquesta arquitectura és ideal. A més, en no dependre d'APIs externes, no hi ha límits de taxa ni costos recurrents, cosa que la fa escalable horitzontalment sense sorpreses a la factura. Si l'empresa necessita processar centenars d'hores d'àudio al dia, es pot desplegar en màquines amb GPU dedicada o fins i tot en instàncies al núvol d'AWS o Azure, configurades amb alta capacitat de còmput i sense enviar dades a serveis de tercers. A Q2BSTUDIO ajudem empreses a migrar i optimitzar les seves infraestructures al núvol, ja sigui a AWS o Azure, garantint que la seguretat i el rendiment estiguin alineats amb els objectius de negoci.
Per posar en marxa el pipeline, només cal Node.js, FFmpeg i els binaris de whisper.cpp. Un script d'instal·lació senzill descarrega el model base des de Hugging Face i compila whisper.cpp. Després, una funció Node.js orquestra tot el flux: rep un fitxer d'àudio, el normalitza, llança la transcripció i guarda el resultat. Hem provat amb gravacions de fins a una hora i funciona de manera estable, tot i que per a fitxers molt llargs recomanem dividir l'àudio en segments de 10-15 minuts per evitar problemes de memòria. Aquest enfocament modular també permet afegir funcionalitats avançades, com la diarització de parlants (qui va dir què) o la transcripció en temps real mitjançant WebSockets, tal com hem desenvolupat internament.
La tecnologia darrere d'aquest pipeline no es limita a la transcripció de reunions. Les aplicacions a mida que desenvolupem a Q2BSTUDIO poden integrar aquest motor de veu a text per a múltiples casos d'ús: des d'assistents virtuals que prenen notes automàtiques fins a sistemes d'anàlisi de sentiment en trucades de vendes. Combinat amb agents d'IA, el text transcrit pot ser processat per generar resums executius, classificar tiquets de suport o extreure dades estructurades. Per exemple, un agent d'IA podria revisar totes les transcripcions del dia i notificar a l'equip si detecta paraules relacionades amb queixes recurrents. Aquestes capacitats es potencien quan s'integren amb solucions al núvol, permetent escalar el processament sense perdre la privacitat de les dades originals.
Si la vostra organització està considerant implementar un sistema de transcripció local, us recomanem començar amb aquest pipeline i després personalitzar-lo segons les vostres necessitats. La clau és la modularitat: podeu canviar el model de Whisper, afegir un servei de sincronització amb el núvol per a còpies de seguretat, o connectar la base de dades SQLite a un sistema de BI per a anàlisis posteriors. A Q2BSTUDIO oferim consultoria i desenvolupament de programari a mida que abasta des de l'arquitectura inicial fins a la posada en producció, incloent integracions amb intel·ligència artificial, ciberseguretat i automatització de processos. No dubteu a contactar-nos per explorar com podem ajudar-vos a transformar les vostres dades d'àudio en informació accionable.





