La navegació assistida per a persones amb discapacitat visual ha avançat significativament gràcies a la intel·ligència artificial i el desenvolupament d'aplicacions a mida que integren models de percepció visual. Tanmateix, un dels reptes més crítics continua sent la segmentació precisa i segura de voreres i carreteres en temps real des d'un dispositiu mòbil. Un error en aquesta tasca pot portar una persona invident o amb baixa visió cap a zones perilloses, com calçades amb trànsit actiu. Per això, la indústria tecnològica i els centres d'investigació estan combinant tècniques d'aprenentatge profund, generació de dades sintètiques i anotacions automàtiques per construir sistemes robustos i desplegables en maquinari limitat.
L'enfocament tradicional de segmentació semàntica, basat en conjunts de dades urbans genèrics com Cityscapes o Mapillary, no captura adequadament la perspectiva de vianant a l'altura del pit. Per solucionar-ho, nous conjunts de dades, com l'esmentat SENSATION-DS, recullen imatges des del punt de vista d'un vianant, etiquetant nou classes rellevants per a la navegació: vorera, carretera, vorada, gespa, arbre, vehicle, vianant, bicicleta i altres. Aquesta taxonomia permet entrenar models que distingeixin amb més fiabilitat el límit entre la zona segura (vorera) i les zones de risc (carretera).
Des d'una perspectiva tècnica, les arquitectures de segmentació han d'equilibrar precisió, velocitat i consum energètic. Models com UPerNet amb backbone MobileNetV3 o DeepLabV3Plus amb MobileNetV3 han estat avaluats en escenaris offline i en dispositius Android reals. Les mètriques habituals, com el mIoU (mean Intersection over Union), són importants però no suficients. Es necessiten indicadors específics de seguretat, com la taxa d'error 'Road-as-Sidewalk' (carretera classificada com a vorera), que mesura falsos positius perillosos. Un model pot tenir un mIoU alt però generar ocasions en què una carretera s'interpreti com a vorera, cosa inacceptable en un sistema d'assistència.
Per millorar la robustesa, s'han aplicat tècniques d'adaptació de domini mitjançant imatges sintètiques condicionades per màscares, generades amb motors de renderitzat com Blender o Unity. A més, l'ús de pseudoetiquetes generades per Segment Anything Model 2 (SAM2) permet etiquetar grans volums de dades sense anotació manual, reduint costos i accelerant el desenvolupament. En els experiments, la combinació d'augmentació sintètica i pseudoetiquetes de SAM2 va aconseguir reduir significativament la taxa d'error Road-as-Sidewalk, en detriment d'una lleugera baixada del mIoU general. Això demostra que l'optimització per a seguretat pot requerir sacrificar una mica de precisió global per minimitzar riscos crítics.
La implementació en mòbils imposa restriccions de memòria, latència i rendiment. DeepLabV3Plus-MobileNetV3 va assolir 7.383 FPS a resolució 512x384 en un dispositiu Android de gamma mitjana, un rendiment acceptable per a aplicacions en temps real. No obstant això, l'eficiència energètica i la compatibilitat amb acceleradors hardware (NPU, GPU) són factors clau. Les solucions comercials han d'integrar a més mecanismes de ciberseguretat per protegir les dades de localització i les imatges capturades, així com garantir que el model no sigui vulnerable a atacs adversarials que alterin la segmentació. En aquest sentit, l'ús de serveis cloud com AWS o Azure permet escalar l'entrenament i la inferència híbrida, mentre que les plataformes de Business Intelligence (Power BI) ajuden a monitoritzar el rendiment del sistema en producció.
A Q2BSTUDIO, com a empresa especialitzada en intel·ligència artificial i desenvolupament de programari, abordem aquests reptes combinant coneixement en visió artificial, optimització de models per a edge computing i arquitectures cloud natives. El nostre equip dissenya aplicacions a mida que integren models de segmentació segura, utilitzant tècniques d'augmentació de dades i pseudolabeling per adaptar-se a entorns urbans reals. A més, oferim serveis de ciberseguretat (pentesting, protecció d'APIs) per salvaguardar la integritat del sistema, i consultoria en cloud AWS/Azure per desplegar pipelines d'entrenament i actualització contínua de models. La incorporació d'agents d'IA permet, per exemple, que el propi sistema detecti quan la segmentació és incerta i sol·liciti intervenció remota o activi modes de navegació més conservadors.
Per al sector de la mobilitat accessible, la col·laboració amb usuaris finals (persones amb discapacitat visual) és indispensable. Les mètriques tècniques s'han de validar amb estudis d'usabilitat i seguretat real, mesurant no només la precisió de la segmentació, sinó la confiança i autonomia que genera en el vianant. Les empreses que aposten per aquest tipus de tecnologia no només compleixen amb normatives d'accessibilitat, sinó que obren un mercat emergent de solucions assistives digitals. La tendència futura apunta a models multimodals que integrin també sensors de profunditat, ultrasons o dades de mapes col·laboratius, tot gestionat des de plataformes al núvol amb capacitats de Big Data i BI.
En resum, la segmentació segura de voreres i carreteres per a navegació assistida en mòbils és un camp on l'excel·lència tècnica s'ha d'alinear amb la responsabilitat social. La combinació d'arquitectures lleugeres, dades sintètiques, pseudoetiquetes i mètriques orientades a la seguretat permet construir sistemes desplegables en smartphones que ofereixen una experiència fiable. Si la teva organització busca implementar una solució de navegació assistida o millorar la percepció visual de les seves aplicacions mòbils, comptar amb un soci tecnològic com Q2BSTUDIO, que integra IA, cloud, ciberseguretat i Business Intelligence, és el primer pas cap a un producte robust i escalable.





