Quan parlem de reconeixement òptic de caràcters (OCR) en dominis amb pocs recursos, la diversitat visual dels manuscrits històrics representa un repte majúscul. El cas del manxú, llengua tungúsica que empra múltiples estils cal·ligràfics —des de l’escriptura regular fins a la semicursiva cancelleresca dels memorials palatins— il·lustra perfectament aquesta complexitat. En escenaris on les dades etiquetades són escasses, els enfocaments tradicionals d’entrenament únic fallen en generalitzar entre estils tan dispars. Aquí és on pren sentit un sistema d’enrutament multi-expert: un conjunt de models especialitzats, cadascun afinat per a un domini visual concret, governat per un classificador lleuger que decideix quin expert processa cada pàgina. Aquest disseny no només eleva la precisió fins a nivells propers a l’oracle que coneix l’etiqueta de domini real, sinó que permet reutilitzar checkpoints d’un procés iteratiu de fine-tuning sense necessitat d’entrenar un expert específic per a cada estil des de zero. En les proves realitzades sobre tres conjunts congelats, el sistema enrutat va assolir una taxa d’error de caràcters (CER) del 0,30 % en escriptura regular, 1,57 % en memorials i 4,83 % en escriptura cursiva, amb una precisió d’enrutament del 99,3 % a nivell de pàgina. Dos dels tres experts seleccionats no havien estat entrenats explícitament per al seu domini final; només l’expert en escriptura cursiva tenia aquest domini com a objectiu. Aquesta troballa subratlla el potencial de reutilitzar models prèviament afinats per a cobrir dominis afins sense cost addicional d’etiquetatge.
Darrere d’aquesta arquitectura hi ha una lliçó estratègica per a qualsevol empresa que hagi d’integrar IA en entorns amb dades limitades. La combinació d’un router lleuger —per exemple, una CNN petita que analitza la textura visual de la pàgina— amb un pool d’especialistes permet escalar a nous dominis amb mínima intervenció manual. Si el classificador identifica un estil per al qual no hi ha expert disponible, se n’entrena un de nou utilitzant el checkpoint més proper, reduint dràsticament el temps d’entrenament. Aquest enfocament és directament transferible a altres escenaris d’OCR històric —com l’àrab antic, el xinès clàssic o els manuscrits medievals europeus— i també a problemes de classificació d’imatges en entorns industrials amb múltiples variants visuals.
Des d’una perspectiva empresarial, implementar un sistema així requereix combinar competències avançades en desenvolupament d’aplicacions a mida, integració de models d’intel·ligència artificial i orquestració al núvol. A Q2BSTUDIO, entenem que cada client s’enfronta a un paisatge de dades únic. Per això oferim solucions completes que van des del disseny del pipeline de dades fins al desplegament de models en producció, passant per la ciberseguretat que protegeix la informació sensible —com manuscrits històrics digitalitzats— i el monitoratge mitjançant quadres de comandament de Business Intelligence. Un sistema d’enrutament multi-expert, per exemple, pot beneficiar-se de la infraestructura elàstica d’AWS o Azure per escalar els experts sota demanda, mentre que un panell de Power BI permet visualitzar en temps real la precisió per domini i detectar desviacions. La incorporació d’agents IA que reentrenen automàticament els experts quan la precisió cau per sota d’un llindar tanca el cicle de millora contínua.
El cas del manxú demostra que no sempre cal una ingent quantitat de dades per aconseguir resultats gairebé perfectes. El que cal és una estratègia intel·ligent de reutilització i enrutament, acompanyada d’eines d’automatització, núvol i ciberseguretat que garanteixin la robustesa del sistema en producció. A Q2BSTUDIO, apliquem aquesta filosofia a projectes de tots els sectors: des de la digitalització d’arxius històrics fins al control de qualitat visual en manufactura, sempre amb un enfocament en solucions de programari a mida que s’adapten a l’evolució del negoci.
Si la teva organització treballa amb documents visualment diversos —siguin manuscrits centenaris o formularis moderns amb diferents dissenys— plantejar-se una arquitectura d’enrutament multi-expert pot marcar la diferència entre un OCR genèric amb altes taxes d’error i un sistema intel·ligent que entén el context visual de cada pàgina. I per portar-ho a la pràctica, comptar amb un soci tecnològic que domini tant la IA com el desenvolupament d’aplicacions a mida, el núvol i la ciberseguretat és clau. A Q2BSTUDIO, estem preparats per acompanyar-te en aquest viatge, des de la conceptualització fins a la posada en producció, integrant les millors pràctiques de la indústria i les últimes innovacions en agents intel·ligents.





