En el último año mi equipo y yo hemos construido un producto de inteligencia artificial que debía servir modelos LLM de gran tamaño de forma fiable, rápida y privada. Partimos de la suposición de que las herramientas existentes simplemente funcionarían, como Git LFS, repositorios de Hugging Face y almacenes de objetos S3 o MinIO, pero al trabajar con safetensors, gguf, ONNX y grandes conjuntos de datos todo se rompió de maneras previsibles y dolorosas.
Los problemas que encontramos eran claros. Git LFS fallaba con archivos de varios gigabytes produciendo corrupción y reintentos extraños. Hugging Face es excelente para hosting público pero para modelos privados presenta límites de tasa, descargas lentas y falta de control de infraestructura. S3 y MinIO son sólidos para objetos genéricos pero tratan los modelos como blobs sin índice de tensores, obligando a descargar archivos completos antes de inferir, lo que es caro cuando se replica por durabilidad.
En nuestra app teníamos usuarios en dispositivos con 4 a 8 GB de VRAM, portátiles que necesitan inferencia local u offline, dispositivos próximos a móviles y nodos distribuidos que requieren arranques rápidos. No podíamos permitir descargas completas de 5 a 15 GB cada vez que se arrancaba una sesión. Necesitábamos inferencia instantánea y descubrimos que los almacenes de objetos tradicionales no estaban diseñados para cargas de trabajo de IA. Teníamos que diseñar algo consciente del modelo.
Así nació Anvil, una tienda de objetos compatible con S3, nativa para IA, escrita en Rust y de código abierto bajo licencia Apache-2.0. Anvil fue concebida como un almacén distribuido que entiende formatos como safetensors, gguf y ONNX, indexa tensores al nivel de archivo, soporta transmisión de tensores, transporte QUIC, codificación por borramiento tipo Ceph, clustering multiregión y despliegue simple Docker-first. Es compatible con APIs gRPC y S3 para facilitar integraciones.
Indexado consciente del modelo. Al subir un archivo, Anvil indexa nombres de tensores, offsets de bytes, tipos de datos, shapes y segmentos de archivo. Esto permite solicitar solo un tensor concreto sin descargar el modelo completo, reduciendo picos de memoria y acelerando arranques. Para workflows de fine-tuning multivariantes y despliegues en dispositivos con recursos limitados, ese índice cambia las reglas del juego.
Transmisión de tensores sobre QUIC. En lugar de descargar el fichero entero, el cliente usa el índice, abre un stream QUIC y solicita únicamente los rangos de bytes necesarios, alimentando los tensores directamente al framework de ML. El resultado es arranques en frío mucho más rápidos, menor transferencia de datos y uso de CPU y memoria notablemente inferior. QUIC aporta multiplexación, control de congestión y menor latencia, ventajas clave en cargas de IA de alto rendimiento.
Codificación por borramiento para objetos de tamaño IA. La replicación tradicional es muy costosa para modelos de 100 GB. Con Reed Solomon y shards configurables se obtiene durabilidad similar con un sobrecoste de almacenamiento mucho menor, y la reconstrucción se realiza de manera automática y distribuida, imprescindible para modelos y datasets de varios gigabytes.
Clustering multi-región y metadata distribuida. Adoptamos un patrón de metadata dividida con Postgres global para información de tenants y definiciones de región, y Postgres regional para índices de tensores, mapas de bloques y journaling. El descubrimiento de nodos se realiza vía libp2p con gossip para liveness y ownership de shards, permitiendo crecimiento del cluster sin configuración compleja y despliegue híbrido entre on premise y cloud.
Diseño práctico y despliegue. Anvil es un binario único y Docker-first para facilitar ejecución en laptops, laboratorios domésticos, clusters pequeños y entornos productivos sin dependencia obligatoria de Kubernetes. Soporta arranque híbrido y multi-región con metadata aislada y ofrece compatibilidad S3 para integrarse con herramientas existentes.
Por qué lo abrimos como código abierto. La infraestructura de almacenamiento merece confianza, auditabilidad y la capacidad de ser extendida por equipos e investigadores. Liberamos Anvil para que equipos puedan ejecutarlo de forma privada, experimentar con índices de tensores, mejorar seguridad y adaptarlo a sus necesidades de ML en producción.
En Q2BSTUDIO, como empresa de desarrollo de software y aplicaciones a medida, aplicamos estas lecciones a soluciones reales para clientes. Ofrecemos servicios de desarrollo de software a medida y aplicaciones a medida, así como proyectos de inteligencia artificial e IA para empresas que incluyen agentes IA, pipelines de inferencia optimizados y despliegues seguros. Además, complementamos soluciones con ciberseguridad y pentesting, servicios cloud AWS y Azure, y servicios de inteligencia de negocio y Power BI para mejorar la toma de decisiones y el rendimiento de negocio.
Si tu organización necesita reducir cold starts, optimizar transferencias de datos para modelos LLM o desplegar infraestrucura AI-native privada, podemos ayudar diseñando integraciones a medida que combinan tecnologías como transmisión tensor sobre QUIC, codificación por borramiento y clustering multi-región. También ofrecemos consultoría para seguridad y cumplimiento, integración con servicios cloud aws y azure, y desarrollos de agentes IA y cuadros de mando con power bi para potenciar la inteligencia de negocio.
En resumen, construir una tienda de objetos nativa de IA implica repensar almacenamiento, transporte y computación: model-aware indexing, tensor-level streaming, QUIC, erasure coding y diseño distribuido son piezas esenciales. En Q2BSTUDIO unimos experiencia en desarrollo de software, IA, ciberseguridad y cloud para llevar estas capacidades a producción de forma segura y eficiente.



