Gemini 3.6 Flash: reduce costes de tokens en agentes empresariales

Gemini 3.6 Flash reduce hasta 65% los tokens en agentes empresariales. Acelera flujos y ahorra costes. Novedades en ciberseguridad.

domingo, 26 de julio de 2026 • 5 min de lectura • Equipo Q2BSTUDIO

Menos tokens, más velocidad: la apuesta de Google para agentes IA

En el ecosistema actual de inteligencia artificial empresarial, la eficiencia en el uso de tokens se ha convertido en un factor crítico para la viabilidad económica de los agentes autónomos. Google ha lanzado Gemini 3.6 Flash y 3.5 Flash-Lite, dos modelos diseñados específicamente para reducir la latencia y el coste por token en flujos de trabajo que requieren razonamiento continuo. Mientras que los modelos de propósito general suelen optimizarse para respuestas rápidas en interfaces conversacionales, los agentes empresariales que operan en segundo plano necesitan un equilibrio diferente: priorizar el rendimiento en tareas repetitivas y minimizar el gasto en cada paso de razonamiento. Aquí es donde Gemini 3.6 Flash marca una diferencia sustancial, al ofrecer hasta un 17 % menos de tokens de salida que su predecesor, según el Artificial Analysis Index, y en benchmarks sintéticos como Datacurve DeepSWE se han registrado reducciones de hasta el 65 %.

Para una empresa que desarrolla aplicaciones a medida con componentes de IA, cada token que un modelo genera representa un coste directo y un incremento en el tiempo de respuesta. Con precios de 1,50 $/1M de tokens de entrada y 7,50 $/1M de tokens de salida, Gemini 3.6 Flash está pensado para bucles de razonamiento que se ejecutan de forma ininterrumpida, no bajo demanda. Esto lo convierte en una opción atractiva para sistemas de automatización de procesos, análisis de documentos legales o financieros, y generación de informes multimodales. Google también ha integrado una herramienta de uso de ordenador nativa en la API de Gemini, eliminando la necesidad de software intermediario personalizado que los ingenieros solían construir para que los modelos pudieran interactuar con sistemas operativos. En la prueba OSWorld-Verified, el modelo alcanzó un 83,0 % de acierto frente al 78,4 % anterior.

El rendimiento en tareas de codificación también ha mejorado de forma significativa. En DeepSWE, Gemini 3.6 Flash logra un 49 % de éxito frente al 37 % de la versión 3.5 Flash. En MLE Bench, el resultado sube del 49,7 % al 63,9 %. Y en GDPval-AA v2, una prueba que mide trabajo intelectual real más allá de rompecabezas de programación, la puntuación pasa de 1349 a 1421. Estas cifras demuestran que el modelo no solo es más barato por token, sino que también es más competente en tareas complejas. Empresas como Figma, Hebbia y Harvey ya lo han integrado en sus infraestructuras de prototipado, análisis de documentos legales e investigación financiera, respectivamente.

Paralelamente, Google ha lanzado Gemini 3.5 Flash-Lite, una variante aún más económica y rápida orientada a tareas de alto volumen. Con un precio de 0,30 $/1M de tokens de entrada y 2,50 $/1M de tokens de salida, alcanza 350 tokens por segundo según el Artificial Analysis Index, siendo el modelo más rápido de la serie 3.5. Está diseñado para subagentes que realizan búsquedas o procesamiento de documentos sin necesidad de razonamiento profundo, permitiendo a los equipos de ingeniería asignar niveles de pensamiento mínimos a tareas sencillas y reservar los niveles superiores para flujos de trabajo multi-paso. En la prueba GDM-MRCR v2 de contexto largo, Flash-Lite obtiene un 72,2 % de éxito frente al 60,1 % de su predecesor, y su puntuación en GDPval-AA v2 casi se duplica, pasando de 642 a 1140.

Otra novedad relevante es Gemini 3.5 Flash Cyber, un modelo restringido para la validación y remediación de vulnerabilidades de código. En un entorno donde las herramientas de escaneo automatizado superan en velocidad a la capacidad de parcheo de los equipos de seguridad, este modelo ofrece una solución específica. Distribuido solo a gobiernos y socios verificados mediante un programa piloto, Gemini 3.5 Flash Cyber se ejecuta en paralelo dentro del agente CodeMender de Google, cotejando hallazgos entre múltiples instancias antes de generar un informe de remediación que un revisor humano aprueba. Esto encaja perfectamente con las necesidades de ciberseguridad empresarial, donde la velocidad y precisión en la corrección de fallos es crítica.

Para las empresas que buscan integrar estas capacidades en sus sistemas, la combinación de modelos de bajo coste y alto rendimiento abre nuevas posibilidades en la automatización de procesos. En Q2BSTUDIO, como empresa de desarrollo de software y tecnología, trabajamos con compañías que necesitan construir agentes de IA personalizados que interactúen con su infraestructura cloud, ya sea en AWS o Azure. La clave está en diseñar una arquitectura que distribuya las tareas entre modelos más ligeros y rápidos (como Flash-Lite) y modelos más potentes (como 3.6 Flash) en función de la complejidad, optimizando así el coste total por operación. Además, la integración con herramientas de Business Intelligence como Power BI permite que estos agentes no solo ejecuten acciones, sino que también alimenten dashboards con datos procesados en tiempo real, facilitando la toma de decisiones.

La reducción de costes de tokens no es solo una mejora incremental: transforma la economía de los agentes autónomos. Antes, ejecutar un bucle de razonamiento de varios pasos podía resultar prohibitivo para tareas que se repiten miles de veces por hora. Con Gemini 3.6 Flash y su variante Lite, el coste por operación se reduce drásticamente, haciendo viable la automatización de procesos que antes requerían intervención humana constante. Esto es especialmente relevante en sectores como la banca, la logística o la sanidad, donde los márgenes son estrechos y la eficiencia es clave.

Para sacar el máximo partido a estos modelos, es recomendable combinarlos con prácticas de automatización de procesos software y una arquitectura cloud escalable. En Q2BSTUDIO ayudamos a las empresas a diseñar soluciones híbridas donde los agentes de IA se ejecutan sobre infraestructura AWS o Azure, utilizando servicios como Lambda, Kubernetes o funciones serverless para manejar picos de demanda sin incrementar los costes fijos. La integración con sistemas de BI como Power BI permite además monitorizar en tiempo real el rendimiento de los agentes y ajustar los modelos según las necesidades del negocio.

Google ha anunciado que Gemini 3.5 Pro continúa en pruebas con socios, y que el preentrenamiento de Gemini 4 ya está en marcha. Esto indica que la competencia por reducir el coste por token se intensificará. Las empresas que adopten ahora estas tecnologías estarán mejor posicionadas para escalar sus operaciones de inteligencia artificial sin que los costes se disparen. En definitiva, Gemini 3.6 Flash no es solo una actualización técnica: es una herramienta estratégica para cualquier organización que quiera integrar agentes de IA en sus flujos de producción de forma rentable y eficiente.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.