Cómo construir un Agente de Investigación Profunda con Pydantic AI

Construye un agente de investigación profunda con Pydantic AI para mejorar tus capacidades analíticas de forma eficiente y precisa.

lunes, 17 de noviembre de 2025 • 4 min de lectura • Equipo Q2BSTUDIO

Building a Deep Investigation Agent with Pydantic AI

HN es excelente para descubrir ideas pero inadecuado para investigación estructurada. A menudo se encuentra un hilo interesante, se piensa volver más tarde y nunca se vuelve. Para preguntas del tipo cómo ha cambiado la opinión en HN sobre Rust frente a Go o qué piensa la comunidad sobre frameworks de agentes estilo LangChain, la búsqueda nativa de HN no basta, porque necesitamos respuestas sobre temas, opiniones y tendencias en ventanas temporales.

Fenic propone una solución situada entre dataframe y capa de contexto diseñada para análisis potenciado por LLM. La idea es declarar qué datos importan, aplicar transformaciones regulares y semánticas para darles forma y luego conectarlo todo a un bucle de agente. Con ello se puede preguntar de forma más alta nivel: mostrar discusiones sobre Rust en los últimos seis meses, comparar cómo se trató el trabajo remoto en 2021 frente a 2024 o resumir argumentos principales a favor y en contra de agentes LLM en los hilos más influyentes.

Qué construimos: un agente de investigación que carga un dataset de Hacker News con historias, comentarios y metadatos; permite filtrar discusiones por tema, tiempo y señales; usa modelos de lenguaje para resumir, comparar y extraer temas; y envuelve todo en un bucle simple donde la pregunta del usuario desencadena consultas sobre fenic y análisis LLM que devuelven respuestas con enlaces de referencia a HN.

Arquitectura general: capa de datos con DataFrames de fenic sobre el dataset; capa de consulta con transformaciones reutilizables que definimos como herramientas MCP; capa LLM con operadores semánticos de fenic para resúmenes y extracción estructurada; y un bucle de agente orquestado con PydanticAI u otra framework que prefieras.

Preparación: necesitas Python 3.10+, una clave de proveedor LLM como OpenAI o Anthropic y las credenciales de Hugging Face para hidratar el dataset público de Hacker News. La carga puede procesar millones de comentarios y cientos de miles de historias, denormalizando en tablas optimizadas para búsquedas rápidas y evitando consultas recursivas costosas.

Definir consultas de investigación con fenic significa crear herramientas parametrizables que operan sobre DataFrames. Por ejemplo, un buscador de historias acepta un patrón regex, combina coincidencias en título, URL, texto y comentarios mediante tablas denormalizadas, y devuelve resultados rankeados por relevancia. Esa abstracción permite al agente realizar búsquedas amplias, refinar y luego sintetizar los resultados.

Integración LLM: fenic ofrece operadores semánticos que encapsulan llamadas a modelos como operaciones de dataframe con batching, reintentos y control de costes. Con ellos se puede pedir al modelo que genere salidas estructuradas usando modelos Pydantic. Un resumen tipo StorySummary puede incluir TLDR, visión general de la historia, puntos clave, temas de discusión con posturas, identificadores de comentarios representativos, riesgos y propuestas de acción. Las salidas tipadas facilitan agregaciones, cálculos de ratios de postura por año o cruzar resultados con metadatos como puntuación y autor.

Bucle de agente: al exponer las herramientas fenic vía un servidor MCP HTTP, el agente (por ejemplo PydanticAI) sigue un proceso guiado: buscar con patrones amplios, resumir las historias más relevantes, leer detalles solo cuando sea necesario y sintetizar hallazgos citando IDs de historia. El resultado es un objeto estructurado de investigación que incluye hallazgos clave, temas recurrentes, controversias, fuentes y limitaciones.

Aplicaciones prácticas: además del análisis de foros públicos como Hacker News, el mismo patrón funciona con hilos internos de empresa, tickets de soporte, exportaciones de Slack o documentos RFC. Puedes filtrar por equipos, áreas de producto o ventanas temporales, extraer datos tipados de texto, agrupar discusiones similares y correlacionar conversaciones con logs o incidentes.

En Q2BSTUDIO, empresa de desarrollo de software y aplicaciones a medida, aplicamos precisamente este enfoque para transformar datos conversacionales y textuales en conocimiento accionable. Ofrecemos servicios de desarrollo de aplicaciones y software a medida y soluciones integrales de servicios de inteligencia artificial para empresas, integrando agentes IA, IA para empresas, power bi y pipelines de datos que potencian decisiones estratégicas. También complementamos proyectos con ciberseguridad, pentesting, servicios cloud aws y azure y servicios de inteligencia de negocio para garantizar despliegues seguros y escalables.

Casos de uso relevantes: análisis de sentimiento y temas en foros para equipos de producto, detección temprana de riesgos técnicos o reputacionales, creación de agentes IA internos que responden a preguntas sobre documentación y políticas, automatización de extracción de insights para informes de inteligencia de negocio y dashboards en Power BI que sintetizan hallazgos cuantitativos y cualitativos.

Cómo empezar: prototipa con un pequeño subconjunto del dataset, crea herramientas MCP parametrizables para búsqueda y resumen, define salidas Pydantic para mantener estructura y trazabilidad, y despliega un servidor MCP que el agente pueda invocar. Itera afinando prompts, límites de búsqueda y criterios de priorización para mejorar precisión y reducir costes.

Si quieres que adaptamos esta arquitectura a tus datos internos, implementemos agentes IA a la medida o diseñemos pipelines seguros en la nube, en Q2BSTUDIO te acompañamos desde la prueba de concepto hasta la producción, integrando prácticas de ciberseguridad, despliegues en servicios cloud aws y azure y visualización con Power BI para maximizar el valor de tus datos.

Conclusión: combinar fenic, modelos de lenguaje y un bucle de agente estructurado permite convertir conversaciones desordenadas en investigación profunda reproducible. Esta receta es especialmente potente para equipos que necesitan extraer tendencias, comparativas históricas y argumentos estructurados a partir de grandes volúmenes de texto. Contáctanos para diseñar un piloto personalizado que aproveche agentes IA, inteligencia artificial para empresas y software a medida enfocado en resultados.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.