Resumen rápido OpenAI lanzó soporte MCP en septiembre de 2025 y la experiencia fue un desastre que se manifestó en errores HTTP 424, payloads JSON malformados, funciones borradas y arreglos que se revertían en producción. Durante semanas los desarrolladores quedaron en el limbo sin respuestas oficiales mientras las demos oficiales fallaban en directo. Frente a esa falta de transparencia construí una pila local de IA con una GPU de 350 USD que hoy supera en fiabilidad y seguimiento de instrucciones a la API cloud.
Acto I La promesa 10 de septiembre El anuncio de Developer Mode prometía compatibilidad completa con MCP para leer y escribir herramientas. Horas después la comunidad reportó llamadas a herramientas fallidas, payloads malformed y violaciones de la propia especificación por parte del cliente MCP de ChatGPT. Para el 12 de septiembre los fallos eran repetibles y contundentes, mientras competidores gestionaban los mismos servidores sin problemas.
Acto II La descomposición progresiva octubre La funcionalidad empezó a desaparecer del producto, los conectores dejaron de listar herramientas y servidores MCP que antes eran estables pasaron a comportarse de forma intermitente. Hilos largos en foros mostraron decenas de desarrolladores con la misma regresión y sin respuesta clara por parte de la empresa.
Acto III El colapso 7 de octubre OpenAI lanzó la vista previa del Apps SDK con demos llamadas Pizza y Solar System que fallaron inmediatamente. Un colaborador interno identificó y fusionó un arreglo que funcionó unas horas y fue revertido en un deploy posterior. El resultado fue un ciclo de arreglar, desplegar, romper y retroceder en producción ante millones de usuarios, mientras la comunicación oficial brillaba por su ausencia.
Acto IV La resaca y la política del silencio octubre en adelante Las cuentas Plus consiguieron sobrevivir de forma intermitente, Business y Enterprise quedaron seriamente afectados y la moderación y comunicación en los foros se redujeron a cero. Cerrar hilos sin resolver y ausencia de un changelog convirtió el debugging público en trabajo gratuito para la comunidad.
Decisión local y experimento Con la infraestructura cloud mostrándose poco fiable decidí migrar a modelos locales en una RTX 3060 de 12 GB. Monté un harness de evaluación para medir estrictamente seguimiento de instrucciones, latencia, velocidad de tokens por segundo y grado de adhesión a resultados JSON puros. La hipótesis era simple: modelos locales bien afinados seguirían instrucciones de formato y protocolo mejor que la API fallida.
Resultados relevantes En pruebas de retorno exacto de JSON y llamadas de herramienta, modelos locales como Granite 20B Function Calling y variantes finas de Qwen2.5 y Hermes superaron consistentemente a la API comparativa. Resumen de hallazgos clave Locales alcanzaron hasta 95% de éxito en tests de instrucción frente a aproximadamente 60% de la API cuando funcionaba correctamente Guardian, un sistema de detección de crisis fine tuned sobre Qwen2.5-7B, alcanzó 90.9% de precisión en escenarios de riesgo suicida y violencia doméstica, con recursos locales y datos adaptados a el contexto de Nueva Zelanda, todo corriendo en hardware de consumo. Coste y fiabilidad A nivel económico la amortización de una GPU de 350 USD se alcanza en torno a dos meses frente a facturas mensuales elevadas de la API. Además desaparecen límites de tasa, latencia de red y la incertidumbre de despliegues ajenos.
Rendimiento y elección operativa Para llamadas críticas uso Granite 20B Function Calling por su fidelidad al protocolo y Qwen2.5-Coder 7B para cargas en tiempo real por su equilibrio entre velocidad y precisión. Alternativas más ligeras como Phi-3.5 Mini ofrecen alta velocidad pero menos disciplina en formato de salida.
Reflexión final La ironía es que la empresa que vende conversación y modelos de lenguaje falló en mantener una conversación con su propia comunidad de desarrolladores. La lección práctica es clara: la IA no es el problema, la opacidad corporativa y la tolerancia a despliegues erráticos sí lo son. Para arquitecturas críticas la opción local ofrece previsibilidad, control y costos menores a medio plazo.
Sobre Q2BSTUDIO En Q2BSTUDIO somos una empresa de desarrollo de software especialista en aplicaciones a medida y software a medida, con experiencia en inteligencia artificial aplicada a empresas, ciberseguridad, servicios cloud aws y azure y servicios de inteligencia de negocio. Ofrecemos soluciones integrales que van desde el desarrollo de aplicaciones a medida hasta proyectos de ia para empresas y agentes IA personalizados. También trabajamos con Power BI para reporting avanzado y automatización de procesos para optimizar flujos operativos.
Qué hacemos y por qué importa Podemos ayudarte a migrar cargas críticas a entornos más predecibles, diseñar arquitecturas híbridas que combinen lo mejor del cloud y lo local, implementar políticas sólidas de ciberseguridad y pentesting, y desplegar servicios en AWS y Azure que respondan a requisitos de disponibilidad y escala. Nuestras competencias en inteligencia de negocio y Power BI permiten convertir datos en decisiones accionables mientras nuestros equipos de IA finetunean modelos para que se ajusten a tus protocolos y formatos sin sorpresas.
Conclusión La confianza se gana con transparencia y fiabilidad operativa. Si tu proyecto depende de respuestas consistentes en formatos estrictos o de sistemas de riesgo que pueden salvar vidas, la opción local controlada por equipos expertos es una alternativa real y rentable. En Q2BSTUDIO diseñamos y desplegamos soluciones que priorizan la precisión, la seguridad y el control, sin depender de la opacidad de terceros.
Contacto Si quieres explorar cómo una estrategia híbrida o una migración a modelos locales puede reducir costes y mejorar fiabilidad, ponte en contacto con nuestro equipo y descubre cómo transformar tus retos en soluciones seguras y escalables.




