Qualificar fulls de respostes escanejats amb OCR: més difícil del que sembla

Descobreix per què qualificar exàmens escanejats amb OCR és més difícil del que sembla i com vam construir una solució robusta que funciona amb escanejos reals.

viernes, 24 de julio de 2026 • 5 min de lectura • Equip Q2BSTUDIO

Cómo resolvimos los desafíos del OCR en el mundo real

Qualificar fulls de respostes escanejades amb sistemes de reconeixement òptic de caràcters (OCR) sembla, a primera vista, un problema resolt. Després de tot, les màquines de scantron porten dècades llegint bombolles en exàmens estandarditzats. No obstant això, quan es trasllada aquest mateix principi a entorns educatius reals —amb professors que usen els seus telèfons per fotografiar proves, variants aleatoritzades i condicions d'il·luminació impredictibles— la complexitat es multiplica. En aquest article explorem els desafiaments tècnics darrere d'aquesta funcionalitat aparentment senzilla i com una aproximació madura de aplicacions a mida pot convertir un prototip de cap de setmana en una eina robusta.

Imaginem una especificació inicial: 'Que els professors escanegin un examen en paper i es qualifiqui automàticament'. Sona raonable, oi? N'hi ha prou amb detectar les bombolles plenes en una graella fixa. Però la realitat és que els exàmens rarament són iguals. Per dificultar les còpies, es generen variants aleatoritzades: diferent ordre de preguntes, diferent ordre de respostes. Això obliga que el sistema llegeixi primer un identificador de variant imprès al full i després seleccioni la clau de correcció adequada. No és un mer lookup estàtic, sinó una decisió dinàmica que s'ha d'executar en mil·lisegons.

El segon gran obstacle és la qualitat de la imatge. Un escàner d'oficina produeix resultats nets i uniformes, però un professor a l'aula normalment fotografia amb el seu mòbil: angles, ombres, plecs al paper, bombolles plenes al 90 % enfront d'un 40 %, o fins i tot esborralls parcials. Un llindar de brillantor global falla immediatament si una part de la foto està més il·luminada que una altra. La solució passa per aplicar correcció de perspectiva abans de qualsevol anàlisi: detectar les marques de cantonada de la pàgina, redreçar i eliminar deformacions, de manera que el motor d'OCR treballi sobre una imatge geomètricament estable.

Un cop corregida la imatge, l'algoritme no ha d'aplicar un únic llindar de farcit per decidir si una bombolla està marcada o no. En lloc d'això, es calcula una puntuació de farcit per bombolla (fill-ratio). Així, les variacions d'il·luminació al llarg de la pàgina no afecten per igual totes les cel·les. Una bombolla amb un 70 % d'àrea fosca pot considerar-se vàlida a la zona superior, mentre que una altra amb el mateix percentatge a la zona inferior podria requerir un ajust fi. Aquest enfocament localitzat millora dràsticament la precisió.

Però la tecnologia no és màgia. Fins i tot amb els millors algoritmes, sorgeixen casos ambigus: bombolles mig esborrades, dues respostes marcades, o marques accidentals. En lloc d'endevinar amb un 50 % de probabilitat, un sistema ben dissenyat assigna un nivell de confiança a cada resposta. Aquelles amb baixa confiança es senyalen perquè el professor les revisi manualment. Aquest és un principi fonamental en sistemes d'IA aplicada: no es tracta d'aconseguir un 100 % d'encerts automàtics, sinó de ser precís quan s'està segur i honest quan no.

Per gestionar la complexitat de les variants, l'identificador de variant s'ha de llegir com un pas d'OCR independent i prioritari. Només després de saber quina clau de respostes correspon, s'avalua cada bombolla. Això implica que el flux de treball té dues etapes clares: primer, identificar la variant; segon, aplicar la correcció corresponent. Si l'identificador es llegeix malament, tot l'examen es pot puntuar contra la clau equivocada, així que la robustesa en aquesta etapa és crítica.

L'experiència en el desenvolupament d'aquest tipus de funcionalitats demostra que el camí des d'una demo funcional fins a un producte llest per a producció està ple de matisos. A Q2BSTUDIO, com a empresa especialitzada en programari a mida, sabem que la clau està a iterar amb casos reals: fotografies preses a aules reals, amb diferents tipus de paper, bolígrafs i condicions de llum. Només així es pot entrenar un model d'IA que generalitzi correctament. A més, l'arquitectura ha de ser escalable i segura. Per això, molts dels nostres projectes es despleguen al núvol amb cloud AWS/Azure, garantint que el processament d'imatges i l'emmagatzematge de resultats compleixin amb els més alts estàndards de ciberseguretat.

Una altra capa de valor afegit és l'analítica de dades. Un cop es digitalitzen les respostes, el sistema pot generar informes detallats sobre el rendiment dels estudiants per pregunta, per tema o per variant. Aquí entra en joc la BI/Power BI, que permet als centres educatius visualitzar tendències i detectar àrees de millora. Fins i tot es poden crear quadres de comandament que alertin sobre preguntes especialment difícils o patrons d'error comuns.

L'automatització de processos és un altre pilar. Si combinem la correcció automàtica amb fluxos de treball que enviïn les notes a plataformes de gestió acadèmica, s'eliminen tasques manuals repetitives. A Q2BSTUDIO hem implementat solucions d'automatització que integren OCR, qualificació i publicació de resultats, alliberant temps valuós per als docents.

A l'horitzó, els agents IA podrien fins i tot predir quines respostes són més propenses a ser ambigües i sol·licitar la intervenció humana de forma proactiva, o recomanar ajustos a les claus de correcció quan detecten patrons inconsistents. La intel·ligència artificial no reemplaça el professor, però sí que pot amplificar la seva capacitat d'anàlisi.

Construir un sistema de qualificació automàtica de fulls de respostes escanejades no és un projecte de cap de setmana. Requereix entendre a fons els problemes de perspectiva, il·luminació, variants i gestió de la incertesa. Però amb la combinació adequada de tècniques de visió artificial, infraestructura cloud i un disseny centrat en l'usuari, es converteix en una eina transformadora. A Q2BSTUDIO ajudem empreses i institucions educatives a desenvolupar aquestes solucions a mida, garantint que cada pas —des de la captura de la imatge fins a la generació de l'informe— estigui optimitzat per al món real.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.