La inteligencia artificial ha avanzado de manera vertiginosa en los últimos años, pero aún persiste un desafío fundamental: garantizar que los modelos no solo respondan preguntas complejas, sino que lo hagan con evidencia visual verificable. En este contexto nace E-VQA (Evidence-Backed Video Question Answering), una nueva tarea que exige a los sistemas de video comprensión ofrecer respuestas semánticas acompañadas de segmentos temporales y máscaras de segmentación densas y rastreadas. Frente a los enfoques tradicionales de





