En Text-to-Speech, les orelles importen més que les mètriques

Descobreix per què en TTS les mètriques com WER i MOS no reflecteixen la qualitat real. Confia en les teves orelles per avaluar síntesi de veu.

viernes, 24 de julio de 2026 • 4 min de lectura • Equip Q2BSTUDIO

Por qué las métricas no garantizan calidad en TTS

Quan vaig començar al món de la síntesi de veu (Text-to-Speech, TTS), esperava trobar-me amb el pipeline clàssic de machine learning: dataset, model, pèrdua d’entrenament i validació. Però aviat vaig descobrir que aquí les regles són diferents. Després d’anys treballant amb assistents intel·ligents i serveis TTS a grans empreses tecnològiques, he après que la mètrica més fiable no és un número en un dashboard, sinó el judici d’una orella humana entrenada. Això contrasta amb altres àrees de la intel·ligència artificial on els indicadors quantitatius solen ser suficients.

Un dels majors desafiaments és la falta de mètriques absolutes fiables. El Word Error Rate (WER) i el Character Error Rate (CER) semblen útils: es sintetitza àudio, es passa per un reconeixedor de veu i es compara amb el text original. No obstant, un model pot generar una veu robòtica amb entonació plana i tot i així mostrar un WER baix. És com avaluar un actor només per si diu totes les paraules correctament, ignorant l’emoció i el ritme. Per això, en projectes complexos de TTS, aquestes mètriques només serveixen per a filtres inicials, no per a decisions finals.

Una altra mètrica molt popular és el Mean Opinion Score (MOS), on els avaluadors puntuen de l’1 al 5. Sembla ideal: absoluta, comprensible, fàcil de presentar. Però a la pràctica el MOS pateix una variància enorme. He vist diferències de fins a 1.5 punts per al mateix àudio entre diferents avaluadors. La raó és que les persones no puntuen de forma consistent sense un context de referència. Si escoltes un sol àudio, el teu criteri canvia segons el teu estat d’ànim, el soroll ambiental o la teva experiència prèvia. Per això, un MOS de 4.0 enfront de 4.4 pot ser estadísticament insignificant.

Per mitigar això, el mètode més fiable és la comparació cara a cara (Side-by-Side, SBS): es presenten dos àudios generats per models diferents i es demana a l’avaluador que triï el millor. Els humans som molt millors comparant que valorant de forma absoluta. El problema és que SBS és relatiu i costós. Si tens N models, necessites comparar entre parells, la qual cosa escala malament. A més, als directius no els agrada mostrar mètriques relatives en informes. Tot i així, en la meva experiència, és l’única manera d’obtenir conclusions sòlides sobre la qualitat perceptiva.

La pèrdua d’entrenament (loss) tampoc no és de fiar. Durant les primeres èpoques, loss i qualitat correlacionen, però en etapes avançades és comú veure checkpoints amb menor loss però pitjor qualitat auditiva. He hagut d’escoltar desenes de mostres generades en diferents passos per triar el millor model. Això significa que la validació esdevé parcialment manual. He arribat a memoritzar paràgrafs de Viquipèdia de tant sentir-los sintetitzats. És una feina tediosa però imprescindible.

En aquest context, les empreses que desenvolupen solucions de veu necessiten un enfocament híbrid. A solucions d’intel·ligència artificial com les que ofereix Q2BSTUDIO, s’integren tant mètriques automàtiques com panells d’escolta humana. La companyia, especialitzada en programari a mida, sap que la qualitat final depèn de la percepció de l’usuari. Per això, en construir sistemes TTS per a assistents virtuals o agents d’IA, és crucial combinar la potència del núvol (AWS/Azure) amb processos de validació perceptiva. La ciberseguretat també hi juga un paper: la veu sintetitzada ha de ser segura contra suplantació, i el business intelligence (Power BI) ajuda a monitoritzar la qualitat a escala.

Els agents d’IA estan revolucionant l’atenció al client, i la veu és el seu canal principal. Un agent que soni robòtic o amb pauses artificials genera desconfiança. Aquí és on l’orella humana esdevé indispensable. Les mètriques poden dir que el model és bo, però només una persona pot detectar una entonació estranya o un èmfasi incorrecte. Per això, a Q2BSTUDIO recomanen sempre una fase d’escolta amb avaluadors entrenats, seguint guies detallades de puntuació que abasten des d’artefactes fins a naturalitat prosòdica.

En resum, la síntesi de veu ens recorda que la intel·ligència artificial no és només matemàtiques. La part subjectiva, l’experiència de l’usuari, requereix eines d’avaluació que van més enllà dels números. Si treballes amb TTS, no confiïs cegament en les mètriques. Entrena la teva orella, escolta mostres, compara versions. I si necessites implementar un sistema robust, comptar amb un soci com Q2BSTUDIO, que entén tant la tecnologia com la percepció humana, pot marcar la diferència entre un assistent que funciona i un que enamora.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.