Docify: Construyendo un Sistema RAG de Producción para la Gestión del Conocimiento

Construye un sistema RAG de producción para potenciar la gestión del conocimiento en tu organización. Aprende a implementarlo de forma efectiva y mejora la productividad de tu equipo.

domingo, 14 de diciembre de 2025 • 6 min de lectura • Equipo Q2BSTUDIO

Construyendo un Sistema RAG de Producción para la Gestión del Conocimiento

Los trabajadores del conocimiento se ahogan en información. Recolectamos documentos a gran escala trabajos de investigación PDFs artículos y código pero a menudo no podemos recuperar ni sintetizar lo recopilado. Docify resuelve este problema eliminando la falsa dicotomía entre mantener datos en local y perder capacidades de IA o migrar a la nube y comprometer la privacidad. La solución integra 11 servicios especializados orquestados en una canalización RAG completa diseñada para entornos de producción.

Entrada y preprocesado. La capa de entrada gestiona ingestión de recursos en formatos heterogéneos PDF DOCX XLSX Markdown TXT. Un servicio de deduplicación calcula hashes SHA-256 sobre el contenido bruto evitando reprocesos cuando el mismo documento llega desde varias fuentes. El servicio de chunking segmenta textos por párrafos y se apoya en conteo de tokens preciso con tiktoken evitando cortar oraciones y preservando jerarquías seccionales y solapamientos controlados para mantener contexto.

Generación asíncrona de embeddings. Para escalar sin bloquear la API Docify desacopla la subida de recursos del cálculo de vectores mediante Celery y Redis: las cargas devuelven respuesta inmediata y trabajadores procesan embeddings en segundo plano. Se emplea un modelo ligero all-minilm:22m con vectores de 384 dimensiones que reduce costes y tamaño de almacenamiento con pérdida mínima de calidad según investigaciones en sentence transformers. Los embeddings se guardan en PostgreSQL con pgvector y un índice HNSW que permite búsquedas vectoriales en menos de 200 ms sobre colecciones de decenas de miles de documentos.

Búsqueda híbrida. La búsqueda semántica por sí sola falla en coincidencias exactas y la búsqueda por palabras clave falla si aparecen sinónimos. Docify combina distancia coseno sobre vectores con ranking BM25 mediante reciprocal rank fusion para fundir filosofías de ranking distintas. Un chunk que sale bien posicionado en ambos sistemas obtiene mejor puntuación que otro muy bueno en uno y pobre en el otro.

Reordenamiento multi factor. El servicio de re-ranking refina resultados con cinco factores ponderados: relevancia base 40% frecuencia de citación 15% recencia 15% especificidad 15% y calidad de la fuente 15%. Se seleccionan 5 a 10 fragments finales para el LLM y se detectan contradicciones entre fuentes señalándolas a la capa superior para transparencia.

Gestión de contexto y presupuesto de tokens. Las ventanas de contexto de los modelos son finitas. La ensambladura contextual respeta presupuestos de token por defecto de 2000 tokens divididos en 60% fuentes primarias 30% contexto de apoyo y 10% metadatos truncando siempre en límites de oración para evitar incoherencias. En la práctica la mayoría de consultas precisan 2 o 3 fuentes de alta calidad no cientos de documentos.

Ingeniería de prompts para evitar alucinaciones. Los prompts siguen reglas estrictas: usar únicamente el contexto proporcionado citar siempre las fuentes indicar cuando la información no está disponible y presentar ambos lados si las fuentes entran en conflicto. Los marcadores de fuente incluidos en el contexto facilitan la verificación posterior de las citas.

Flexibilidad de proveedor de LLMs. La arquitectura es agnóstica al proveedor. Por defecto se puede usar Ollama con Mistral 7B cuantizado a 4 bits en local y también soportar OpenAI o Anthropic. La capa de ejecución detecta hardware: si hay GPU acelera si es CPU ajusta timeouts y si la VRAM es baja cambia a modelos más pequeños. El streaming está habilitado para mejorar la experiencia de usuario.

Verificación de citas. Como los modelos pueden inventar fuentes Docify ejecuta una verificación post generación que extrae referencias de tipo Fuente N busca las afirmaciones citadas dentro de los fragments originales y marca discrepancias. Esto captura errores graves como citar documentos sin información relevante y reduce significativamente las alucinaciones aunque no las elimina por completo.

Orquestación de la canalización. El servicio de generación de mensajes coordina todos los pasos: expansión de consulta en 3 a 5 variantes búsqueda híbrida devolviendo 20 a 30 candidatos re-ranking selección de 5 a 10 ensamblado de contexto con presupuesto de tokens ingeniería de prompt llamada al LLM verificación de citas y respuesta final. La API entrega datos estructurados: contenido del mensaje UUIDs de fuentes citas resultados de verificación y latencias de cada etapa para trazabilidad.

Diseño de base de datos y escalabilidad. La tabla de fragments está optimizada para búsqueda vectorial con campos de id UUID referencia a recurso contenido embedding de 384 dimensiones y metadatos JSONB además de un índice HNSW sobre el vector. La tabla de recursos incorpora content_hash VARCHAR 64 único con referencia de duplicado para deduplicación. Conversaciones y mensajes guardan historial con trazado de fuentes y metadatos de modelo. Los workspaces permiten aislar datos por equipo o usuario mediante workspace_id en consultas.

Infraestructura y API. Un stack Docker con PostgreSQL pgvector Redis Ollama backend FastAPI y workers Celery simplifica despliegue y asegura que los servicios dependientes realizan comprobaciones de salud antes de arrancar. En el frontend React 18 y TypeScript con React Query para gestión de estado y Zustand para UI garantizan una experiencia fluida mientras que Tailwind facilita estilos rápidos. Los endpoints REST incluyen subida de recursos consulta de estado de embeddings y disparo de la canalización RAG.

Patrones de diseño clave. Entre los patrones implementados destacan enfoque async first para embeddings y LLMs deduplicación por hash SHA-256 fusión híbrida de búsqueda ensamblado consciente de tokens re-ranking multifactor verificación de citas y adaptación automática al hardware disponible.

Sobre Q2BSTUDIO. Q2BSTUDIO es una empresa de desarrollo de software y aplicaciones a medida especializada en soluciones de inteligencia artificial ciberseguridad y servicios cloud. Nuestro equipo construye software a medida y aplicaciones a medida integrando capacidades de agentes IA y herramientas como power bi para inteligencia de negocio. Ofrecemos servicios cloud aws y azure y consultoría en servicios inteligencia de negocio orientada a resultados. Si buscas desplegar soluciones de IA para empresas o desarrollar una plataforma RAG a medida contamos con la experiencia para acompañarte desde la arquitectura hasta la puesta en producción. Conoce nuestras opciones de servicios en inteligencia artificial en soluciones de inteligencia artificial para empresas y descubre cómo desarrollamos aplicaciones con foco en calidad y seguridad en software a medida y aplicaciones a medida.

Casos de uso y beneficios. Docify es útil para investigación corporativa cumplimiento normativo soporte técnico y equipos de producto que necesitan respuestas fundamentadas y verificables. Reduce el tiempo de búsqueda aumenta la confianza en las respuestas automatizadas y mantiene control local de datos cuando la privacidad es crítica. Integrado con procesos de ciberseguridad y pentesting puede alimentar bases de conocimiento seguras y auditables.

Conclusión. Un sistema RAG de producción como Docify combina ingestión robusta deduplicación conteo preciso de tokens embeddings ligeros almacenamiento vectorial eficiente búsquedas híbridas re-ranking multifactor gestión de contexto verificación de citas y adaptación al hardware para ofrecer respuestas verificables y escalables. En Q2BSTUDIO ayudamos a transformar estas arquitecturas en soluciones reales adaptadas a cada organización integrando IA para empresas agentes IA ciberseguridad y servicios cloud aws y azure para maximizar valor y minimizar riesgo.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.