Cómo funcionan realmente los agentes en profundidad: un recorrido por la arquitectura de Browsr
Los agentes profundos no fallan de forma ruidosa, sino que derivan. Tras 10 a 50 pasos de ejecución, depurar se convierte en adivinanza: no queda claro qué llamada a herramienta provocó el problema, por qué cambió el plan o dónde explotaron el coste y el contexto. En este artículo traducido y reescrito describimos cómo opera internamente un agente profundo real al analizar la arquitectura de Browsr, un agente basado en navegador, y observando su ejecución paso a paso.
Qué hace que un agente sea profundo: mantiene un plan o lista de tareas en curso sobre lo que queda por hacer; usa herramientas como navegador, shell o APIs para actuar en el mundo paso a paso; guarda memoria persistente con artefactos, notas y resultados intermedios para no olvidar trabajo previo; y evalúa su propio progreso, ajusta el plan y reintenta cuando algo falla. Gracias a capacidad de planificar, recordar y corregirse, un agente profundo puede ejecutarse durante muchas iteraciones sin perder el hilo de la tarea.
Presentamos Browsr: Browsr es un agente headless de navegador que permite crear secuencias siguiendo el patrón de agente profundo y luego exporta los payloads para ejecutar APIs a escala. Además extrae datos de sitios web en formato estructurado o en markdown compatible con LLM. A alto nivel Browsr planifica explícitamente su siguiente acción, ejecuta comandos de navegador en pasos controlados, persiste estado entre iteraciones y evalúa el progreso antes de continuar.
Para hacer la ejecución observable usamos vLLora, una herramienta de observabilidad para agentes que captura trazas a nivel de petición y líneas de tiempo durante la ejecución. Con vLLora inspeccionamos llamadas a herramientas y el timeline completo del agente, lo que resulta clave para detectar drift, puntos de coste y decisiones erráticas. vLLora funciona con los modelos más populares y facilita convertir la depuración en inspección repetible.
Cómo opera Browsr por dentro: el driver browser_step es el ejecutor principal; cada turno realiza entre 1 y 3 comandos de navegador agrupados como un solo paso, e incluye razonamiento explícito, evaluation_previous_goal, memoria y next_goal. El prompt del sistema obliga al modelo a leer el DOM y la captura de pantalla más recientes, reportar el estado actual y decidir la siguiente acción. Cada respuesta del agente debe contener thinking para razonar sobre el estado actual, evaluation_previous_goal como veredicto del paso anterior, next_goal en una sola frase y commands con el array de comandos a ejecutar. Esta estricta convención garantiza una ejecución determinista y debugeable porque obliga a una sola llamada a herramienta por respuesta, sin texto libre adicional.
Control de contexto y persistencia: salidas muy grandes de herramientas se escriben en disco como artefactos para que el modelo no cargue tokens innecesarios y los recargue bajo demanda. El bucle estado a estado suele ejecutarse en hasta ocho iteraciones, cada una anclada en el último bloque de observación compuesto por DOM y captura de pantalla para minimizar alucinaciones. En un ejemplo representativo Browsr navegó en el paso uno, hizo click en el paso dos y luego ejecutó una evaluación JS para devolver datos estructurados de la página.
Trazas y costes: en ejecuciones con gpt-4.1-mini se observó un coste medio por trazado de aproximadamente 0.0303 dólares y una media de 10.5 pasos por ejecución. Estos números son útiles para planificar presupuesto y optimizar ramas costosas en agentes que operan a escala.
Por qué la observabilidad es crítica para agentes profundos: cuando los agentes superan prompts de una sola ejecución, la depuración deja de ser directa. Los ingenieros suelen ajustar prompts de sistema, recorrer llamadas a herramientas y adivinar el fallo en el tramo medio de una ejecución larga. En carreras de 50+ pasos con cientos de decisiones, las fallas rara vez tienen una causa única y clara, por eso la observabilidad es esencial.
Problemas frecuentes que detecta la observabilidad: deriva con el tiempo por contexto ruidoso o instrucciones mal interpretadas; explosiones de coste por ramas inesperadas o tokens masivos; y decisiones no trazables que impiden ver la cadena causal. Documentar qué leyó el agente, qué decidió y qué ejecutó en cada paso transforma la depuración en evidencia y no en especulación.
Herramientas como vLLora exponen trazas a nivel de petición y permiten ver lo que un agente profundo hace durante toda la ejecución, no solo el resultado final. Esto es imprescindible para saber si el gasto se concentra en planificación, ejecución de herramientas, reintentos o extracción de datos.
Cómo puede ayudarte Q2BSTUDIO: en Q2BSTUDIO somos una empresa de desarrollo de software y aplicaciones a medida que combina experiencia en software a medida, aplicaciones a medida y soluciones avanzadas de Inteligencia artificial para empresas. Diseñamos agentes IA confiables, arquitecturas observables y pipelines escalables que incorporan mejores prácticas de ciberseguridad y control de costes en cloud. También ofrecemos servicios de ciberseguridad, pentesting y soporte para entornos servicios cloud aws y azure.
Si tu organización necesita extraer valor de datos web con agentes inteligentes, integrar soluciones de inteligencia de negocio o desplegar paneles con power bi, en Q2BSTUDIO cubrimos desde la consultoría hasta la entrega final. Para proyectos que requieran integración y escalado podemos apoyar creando arquitecturas a medida que automatizan procesos y preservan trazabilidad de decisiones.
Conclusiones clave: los agentes profundos fallan de forma gradual, no catastrófica; la observabilidad convierte la depuración en inspección en lugar de conjetura; el coste, el contexto y el comportamiento son preocupaciones arquitectónicas; y una ejecución de herramienta determinista hace comprensibles las corridas largas. Si quieres profundizar en patrones de observabilidad, anatomía de agentes o herramientas para agentes IA, contacta con nosotros en Q2BSTUDIO para explorar soluciones a medida que unan inteligencia artificial, ciberseguridad y servicios cloud en un solo proyecto.





