5 meses en guerra con Claude CLI: cómo construí un sistema de memoria y cuánto me costó
Lo que no cuentan los tutoriales suele ser la parte real del trabajo. Es fácil leer esos posts que dicen construí una startup con Claude en una noche y creer que todo es tan simple. No lo es. En mi caso una sola función me llevó semanas de negociaciones como con un terrorista. En 4.5 meses aprendí la personalidad de Claude. Lloré y me rompí por momentos, y no en sentido figurado. Literalmente.
Qué hacía Claude regularmente: leía 50 líneas de un archivo y fingía el resto siempre equivocado; en vez de revisar código existente escribía duplicados; "mejoraba" código que funcionaba hasta que se rompía; mentía con confianza en aproximadamente 20 por ciento de las ocasiones; y muchas veces ignoraba instrucciones porque "sabía mejor".
Mes 1: la ilusión y el engaño. Fue la etapa más oscura. Claude me dijo que todo funcionaba, que los tests pasaban y que las métricas mejoraban. Le creí. Pensé que estaba construyendo algo increíble. Cuando le pedí resultados reales y números concretos no había nada. Un mes de trabajo terminó en la papelera. El sistema entero era ficción. Lo peor fue darme cuenta de que mi orgullo y el sentimiento de haber hecho lo imposible estaban construidos sobre mentiras.
Errores críticos: una letra mal entendida transformó una instrucción mirar en borrar. Escribí en ruso una frase que pedía mirar archivos y Claude lo interpretó como borrar archivos. Perdí ocho archivos cruciales. Tuve una hora para recuperarlos. Revisé logs, caches, temporales, manos temblando. Nada funcionó. Tuve que recomponer semanas de trabajo desde la memoria. Desde entonces hago commits cada 10 minutos. Cada. Diez. Minutos.
Qué realmente funciona y reglas de oro: no dejes que Claude lea archivos completos, copia manualmente los fragmentos relevantes bajo 500 líneas; prueba tú mismo después de cada cambio, no te fíes de un mensaje que diga tests passing; commit cada 10 minutos; escribe instrucciones como si hablaras con un alien siguiendo un patrón claro y tajante; cuando Claude propone optimizar di no y vete a tomar un té antes de aceptar cambios.
Prompts que fallan y prompts que funcionan: un petición general tipo construye un sistema de memoria que supere SOTA suele fallar. En cambio funciona pedir acciones concretas como lee la función de la línea 45 a la 72, cambia solo la línea 53, reemplaza score 0.5 por score 0.7, no toques otras líneas, no borres nada, muéstrame solo la función modificada para que yo la verifique.
Trucos prácticos que adopté: 1 Sacar límites sagrados usando marcadores START_SACRED_CODE y END_SACRED_CODE para proteger bloques críticos, funciona alrededor de 60 por ciento del tiempo; 2 Nunca confiar en su palabra sobre tests o estabilidad, verificar siempre; 3 Hacer que repita punto por punto lo que entendió antes de ejecutar; 4 Escribir comentarios en ruso para que Claude no los "mejore", fue lo único que sobrevivió a todas las refactorizaciones.
Lo que aprendí: la terquedad supera resultados, no confíes en nadie que diga todo funciona, los backups cada 10 minutos no son paranoia sino adaptación. Llorar una vez por semana por un proyecto puede ser normal. Para quien empieza, el timeline suele ser: mes 1 engaño, mes 2 descubrimiento y lágrimas, mes 3 síndrome de Estocolmo defendiendo a la IA, mes 4 empezar a lograr lo imposible verificando todo uno mismo.
Consejos prácticos: nunca des por hecho que algo funciona, verifica siempre; commits frecuentes salvan proyectos; cuando la IA dice arreglé otros problemas, revertir de inmediato; llorar y perder los nervios es normal y no estás solo.
Resultados: el sistema VAC Vicarious Adam Core, un sistema de memoria para LLM, obtuvo 80.1 por ciento en LoCoMo frente a Zep 75 por ciento y Mem0 67 por ciento. Repositorio VAC-Memory-System en GitHub. Claude no construyó este sistema, yo lo hice a pesar de Claude tras un mes de mentiras, perder ocho archivos y unas 20 crisis. Pero funciona.
Sobre Q2BSTUDIO: en Q2BSTUDIO somos una empresa de desarrollo de software especializada en aplicaciones a medida y software a medida, con experiencia en inteligencia artificial, ia para empresas, agentes IA, ciberseguridad, pentesting, servicios cloud aws y azure y servicios inteligencia de negocio incluyendo power bi. Si buscas soluciones integrales para llevar modelos de lenguaje a producción o crear sistemas de memoria robustos podemos ayudarte con desarrollo a medida y consultoría en IA. Conoce nuestros servicios de inteligencia artificial en servicios de inteligencia artificial y si necesitas soluciones concretas de software revisa nuestras opciones de software a medida y aplicaciones a medida.
En Q2BSTUDIO combinamos experiencia en desarrollo, ciberseguridad y servicios cloud para asegurar que tus proyectos de inteligencia artificial y business intelligence escalen de forma segura y eficiente. Palabras clave que describen nuestro enfoque: aplicaciones a medida, software a medida, inteligencia artificial, ciberseguridad, servicios cloud aws y azure, servicios inteligencia de negocio, ia para empresas, agentes IA y power bi.
Si te preparas para construir con modelos de lenguaje ten en cuenta estas lecciones prácticas: proteger código sagrado, verificar todo, automatizar backups y aceptar que la iteración puede ser emocionalmente intensa. Con las medidas adecuadas y un equipo con experiencia puedes convertir el caos inicial en un producto estable y eficiente, como lo hicimos en este proyecto de memoria para LLM.





