Photon-1: AI Learns from Raw Video Without Action Labels

Induction Labs' Photon-1 pretrains on 18 years of screen recordings, beating Gemini on an internal benchmark with 27x less compute. No action labels needed.

lunes, 27 de julio de 2026 • 5 min read • Q2BSTUDIO Team

Modelo de imaginación que predice futuros fotogramas

El aprendizaje automático a partir de vídeo ha dependido tradicionalmente de una restricción crítica: la necesidad de etiquetar cada acción que produce cada fotograma. Este requisito ha limitado la escalabilidad y la aplicabilidad de los modelos, especialmente cuando se trata de grandes volúmenes de datos no estructurados. Recientemente, Induction Labs ha presentado Photon-1, un modelo de inteligencia artificial que rompe con esta norma al aprender directamente de secuencias de vídeo sin ningún tipo de etiqueta de acción. Este avance promete transformar la manera en que las máquinas comprenden y simulan entornos visuales, abriendo nuevas posibilidades para la automatización y la toma de decisiones autónoma.

Photon-1 se basa en una arquitectura denominada 'modelo de imaginación' (imagination model). En lugar de predecir píxeles futuros, el modelo opera en un espacio latente: predice el siguiente estado latente de forma autorregresiva. Esto significa que durante el preentrenamiento nunca genera imágenes visibles, sino que aprende una representación comprimida del cambio entre fotogramas. El codificador de vídeo utiliza cuantización escalar finita (FSQ) para convertir cada fotograma en 960 tokens discretos, cada uno con un vector de ocho dimensiones y cinco valores posibles. El resultado es una compresión superior a 100 veces en comparación con representaciones tradicionales basadas en OCR o modelos multimodales, manteniendo información crucial como texto, diseño y cambios de estado.

El entrenamiento de Photon-1 se realizó sobre un corpus de 575 millones de fotogramas extraídos de grabaciones de pantalla de ordenador durante 18 años. Con una arquitectura de mezcla de expertos (MoE) de 106 mil millones de parámetros (5 mil millones activos), el modelo se preentrenó durante aproximadamente 30.000 horas en GPU H200, utilizando 4,4×10²² FLOPs. Sorprendentemente, Induction Labs afirma que Photon-1 supera a Gemini 3.1 Flash-Lite en un benchmark interno de uso de ordenador, empleando 27 veces menos cómputo de preentrenamiento y costando tres veces menos en inferencia. Estos resultados desafían la noción de que los modelos más grandes y con más datos son siempre superiores.

Lo que hace único a Photon-1 es su capacidad para aprender una política implícita. Al predecir fotogramas futuros a partir de secuencias sin acciones, el modelo internaliza conceptos de lo que una persona está haciendo, no etiquetas concretas como 'clic' o 'tecla'. Después, mediante un ajuste fino con menos de 35.000 trayectorias de uso de ordenador y un proceso de aprendizaje por refuerzo en línea, el modelo aprende a emitir acciones que llevan al estado deseado. En inferencia, primero predice el siguiente estado y luego genera la acción correspondiente. Esto abre la puerta a sistemas que pueden operar en entornos complejos sin necesidad de supervisión humana detallada.

Más allá del escritorio, Photon-1 demuestra una capacidad de generalización sorprendente. Al ser evaluado en dominios nunca vistos durante el preentrenamiento, como partidas de damas o simulaciones de billar, el modelo superó a líneas base basadas en LLMs y codificadores visuales. En billar, produjo un error absoluto medio de 0,47 frente al físico real, comparado con 1,15 del LLM. Esto sugiere que el modelo ha aprendido principios físicos y táctiles a partir de la observación pasiva de pantallas. También aprendió a utilizar un clon de ChatGPT dentro de una máquina virtual para redactar documentos y responder preguntas, imitando el comportamiento humano.

Este avance tiene implicaciones profundas para el desarrollo de software y la automatización empresarial. Imaginemos sistemas que aprenden a manejar aplicaciones solo observando cómo las usan los empleados, sin necesidad de programar cada flujo de trabajo. O asistentes virtuales que entienden el contexto visual de una pantalla y actúan en consecuencia. En Q2BSTUDIO, empresa especializada en desarrollo de tecnología, vemos este tipo de innovaciones como una oportunidad para ofrecer aplicaciones a medida que integren modelos de IA de última generación. Nuestro equipo puede ayudar a las empresas a adoptar soluciones basadas en visión artificial y aprendizaje por refuerzo, adaptándolas a sus necesidades específicas.

La combinación de Photon-1 con infraestructura cloud robusta es otro factor clave. Para ejecutar el aprendizaje por refuerzo en línea a escala, Induction Labs utilizó máquinas virtuales Linux con múltiples entornos de escritorio. En Q2BSTUDIO, ofrecemos servicios de cloud AWS y Azure que permiten desplegar y escalar este tipo de sistemas de forma eficiente, garantizando alta disponibilidad y seguridad. Además, la ciberseguridad es fundamental cuando se manejan datos de usuario o se interactúa con aplicaciones web; nuestras soluciones de pentesting y protección ayudan a mitigar riesgos.

La analítica de datos y la inteligencia de negocio también se benefician de modelos como Photon-1. Al comprender el estado de una interfaz, un agente de IA podría extraer información de informes, dashboards o aplicaciones sin necesidad de APIs especializadas. En Q2BSTUDIO, desarrollamos soluciones de BI con Power BI que se integran con sistemas de IA para ofrecer insights en tiempo real. La automatización de procesos, otro de nuestros fuertes, se potencia con agentes IA capaces de navegar por aplicaciones y realizar tareas repetitivas.

Sin embargo, Photon-1 es aún un resultado de investigación: no hay pesos públicos, API ni licencia disponible. Induction Labs ha publicado un informe técnico detallado y un hilo en X, pero la comunidad espera ver reproducciones independientes y aplicaciones comerciales. Aun así, el concepto de 'política implícita' aprendida sin etiquetas podría marcar un antes y un después en el campo de la robótica, la automatización de escritorio y la simulación de entornos.

Desde la perspectiva empresarial, este tipo de avances subrayan la importancia de invertir en I+D en inteligencia artificial. Las compañías que quieran mantenerse competitivas deben explorar cómo integrar modelos generativos y de aprendizaje autosupervisado en sus operaciones. En Q2BSTUDIO, ofrecemos consultoría y desarrollo de agentes IA personalizados, adaptando técnicas como las de Photon-1 a casos de uso reales, ya sea para control de calidad visual, asistentes virtuales o automatización de flujos de trabajo complejos.

La lección principal es que predecir el futuro (en forma de fotogramas) puede enseñar a una máquina a actuar en el presente, sin necesidad de una supervisión exhaustiva. Photon-1 es un ejemplo brillante de cómo la compresión eficiente de la información visual, combinada con arquitecturas MoE y aprendizaje por refuerzo, puede generar políticas implícitas robustas. A medida que estos modelos maduren, veremos aplicaciones en campos como la salud, la fabricación y el entretenimiento. Y en Q2BSTUDIO estaremos preparados para ayudar a las empresas a dar ese salto.

A BREAK?

Play for a moment before you go

OUR SERVICES

How we can help you

Do you have a project in mind?

Tell us your vision and we'll turn it into a software solution. Whatever the scope, we make your idea real.