Classificació d'àudio few-shot open-set amb prototips fusionats per atenció

Descobreix FOAC: un mètode innovador per a classificació d'àudio amb poques mostres que detecta classes vistes i rebutja les desconegudes, millorant precisió i

viernes, 3 de julio de 2026 • 2 min de lectura • Equip Q2BSTUDIO

Mètode FOAC per a classificació oberta amb poques mostres

En l'àmbit de la intel·ligència artificial aplicada al processament d'àudio, un dels desafiaments més complexos és aconseguir que un sistema sigui capaç d'identificar sons de classes conegudes a partir d'un nombre reduït d'exemples –el que es coneix com a aprenentatge few-shot– i, alhora, rebutjar sons que pertanyen a categories mai vistes durant l'entrenament. Aquesta doble capacitat s'anomena classificació open-set few-shot i resulta crítica en entorns dinàmics com la vigilància acústica, els assistents virtuals o la monitorització industrial, on apareixen constantment esdeveniments sonors imprevistos.

La proposta tècnica que aborda aquest problema es basa en una arquitectura composta per un codificador (una xarxa ResNet que extreu representacions vectorials o embeddings) i un classificador que genera prototips tant per a les classes de pocs exemples (few-shot) com per a les classes obertes (open-set). La clau innovadora resideix en la fusió atencional: en lloc de fer la mitjana de les mostres de suport, es ponderen les parts més representatives d'aquests embeddings, combinant-les a més amb la informació discriminativa de les consultes. Això permet obtenir prototips més precisos que milloren la separació entre classes vistes i no vistes. El model s'entrena inicialment amb una gran quantitat de classes base en mode supervisat, i després s'afina mitjançant meta-entrenament amb pocs exemples de les classes objectiu.

Des d'una perspectiva empresarial, aquest tipus de solucions obre la porta a sistemes d'intel·ligència artificial molt més robustos i adaptables. Per exemple, en aplicacions de ciberseguretat, un sistema de detecció d'intrusions acústiques pot aprendre a reconèixer ràpidament nous patrons de so sospitosos sense necessitat de tornar a entrenar tot el model, mentre que rebutja sorolls ambientals irrellevants. La implementació pràctica d'aquests desenvolupaments requereix equips multidisciplinaris que integrin tant el coneixement algorítmic com l'enginyeria de programari a mida.

A Q2BSTUDIO oferim serveis avançats d'intel·ligència artificial per a empreses, incloent el desenvolupament de models de classificació d'àudio i la integració en plataformes productives. El nostre equip dissenya aplicacions a mida que incorporen tècniques de few-shot learning i rebuig open-set, garantint que el sistema s'adapti a les dades reals del client sense saturar de falsos positius. A més, acompanyem aquests desplegaments amb serveis cloud AWS i Azure que escalen la inferència en temps real, i amb solucions d'intel·ligència de negoci com Power BI per visualitzar les mètriques de rendiment del model. També treballem amb agents IA que automatitzen la resposta davant esdeveniments sonors crítics, i oferim serveis de ciberseguretat per protegir els pipelines de dades i models. Tot això ho aconseguim mitjançant un enfocament de desenvolupament de programari a mida, on cada component s'ajusta a les necessitats específiques del projecte.

En resum, la classificació d'àudio few-shot open-set amb prototips fusionats per atenció representa un avenç significatiu cap a sistemes d'intel·ligència artificial més flexibles i segurs. A Q2BSTUDIO estem preparats per transformar aquests conceptes acadèmics en solucions empresarials reals, ajudant les organitzacions a aprofitar el potencial del so com a font de dades intel·ligent.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.