Evaluación de relevancia impulsada por LLM para la búsqueda en Pinterest

Maximiza la relevancia de tus publicaciones en Pinterest con la ayuda de un LLM. Descubre cómo potenciar tu presencia en esta plataforma de manera efectiva.

viernes, 12 de diciembre de 2025 • 6 min de lectura • Equipo Q2BSTUDIO

Relevancia impulsada por LLM en Pinterest

Introducción: la relevancia en la búsqueda mide qué tan bien se alinean los resultados con la intención del usuario. En sistemas de búsqueda personalizados es clave presentar contenido pertinente a la necesidad informativa del usuario y no depender en exceso de interacciones pasadas. En Pinterest Search se mide la relevancia de página completa mediante experimentos A/B en línea para evaluar nuevos modelos de ranking y mantener una experiencia de alta calidad.

Resumen del enfoque: la medición tradicional depende de anotaciones humanas, pero la baja disponibilidad y el alto coste marginal de etiquetas humanas limitaban el tamaño muestral y la capacidad para detectar efectos heterogéneos o cambios pequeños en métricas principales. Para resolver estos cuellos de botella se desarrolló una metodología que escala el etiquetado mediante LLMs finamente ajustados con etiquetas humanas y se usan estos modelos para evaluar resultados de ranking entre grupos experimentales. Esto reduce costes y tiempos de etiquetado, permite ampliar conjuntos de consultas y refinar el diseño de muestreo, mejorando la calidad de la métrica.

Guía de relevancia y modelado: utilizamos una guía de 5 niveles para medir la relevancia semántica entre consulta y Pin: Altamente Relevante L5, Relevante L4, Marginalmente Relevante L3, Irrelevante L2 y Altamente Irrelevante L1. El modelo de relevancia se plantea como un problema de clasificación multiclase donde se minimiza la entropía cruzada punto a punto. La arquitectura empleada es un cross-encoder que toma en conjunto la consulta y la representación textual completa del Pin para predecir la etiqueta de relevancia con la mayor puntuación.

Representación de Pins: para representar cada Pin de forma robusta se combinan múltiples características textuales como título y descripción del Pin, leyendas generadas por BLIP, títulos y descripciones de la página enlazada, títulos de tableros donde se guardó el Pin y tokens de consulta con alta interacción asociados al Pin. Estas fuentes juntas crean una representación textual rica que mejora la precisión del juicio de relevancia.

Modelos y multilingüismo: se experimentó con modelos multilingües como multilingual BERT, T5, mDeBERTa, XLM-RoBERTa-large y Llama-3–8B. Se aprovechó la capacidad cross-lingual de modelos multilingües para soportar consultas y Pins en varios idiomas. Tras el ajuste fino se generan puntuaciones en 5 dimensiones y se selecciona la etiqueta por argmax para la evaluación.

Diseño de muestreo estratificado: el etiquetado con LLMs reduce costes y tiempos lo que permite diseños muestrales mucho mayores. Se propone un muestreo de consultas estratificado que posibilita medir efectos heterogéneos y reducir el mínimo efecto detectable MDE en un orden de magnitud. La estratificación asegura representatividad y cuando las estratas son relativamente homogéneas produce una reducción importante de la varianza. Para definir estratos se usa un modelo interno query-to-interest basado en DistilBERT combinado con un segmento de popularidad que mide el volumen de búsqueda de cada consulta.

Impacto en sensibilidad experimental: antes del etiquetado con LLMs los MDE eran elevados, por ejemplo 1.3 a 1.5 por ciento, debido a restricciones en el muestreo impuestas por el coste de anotación humana. Con LLMs se aumentaron los tamaños de muestra, se pasó del muestreo aleatorio simple a muestreo estratificado con estimador estratificado y asignación óptima de unidades por estrato. Así logramos reducir MDEs hasta torno a 0.25 por ciento. La mayor parte de la mejora proviene de la reducción de varianza gracias a la estratificación, consistente con hallazgos previos que muestran que la mayor variación en relevancia ocurre entre consultas.

Métrica sDCG@K y evaluación por pares: para evaluar el impacto de un experimento A/B en ranking tomamos una muestra estratificada de consultas emparejadas entre control y tratamiento, bloqueando diferencias entre consultas. Para cada consulta conservamos los top K resultados y generamos etiquetas LLM. Calculamos sDCG@K por consulta y agregamos métricas a nivel de consulta para derivar métricas topline. En esta configuración utilizamos K igual a 25. También calculamos efectos heterogéneos por popularidad e interés de la consulta y controlamos la tasa de falsos positivos con el procedimiento Benjamini-Hochberg.

Validación y alineamiento con etiquetas humanas: en validación se observó un alto alineamiento entre etiquetas generadas por LLM y anotadores humanos. A nivel de Pin la coincidencia exacta fue del 73.7 por ciento y el 91.7 por ciento de las veces la discrepancia fue como máximo de un punto en la escala de cinco niveles. A nivel de consulta se midieron correlaciones por rangos como Kendall y Spearman sobre sDCG@K y se observó robustez en segmentos de popularidad diversos. La distribución de errores en métricas a nivel de consulta estuvo fuertemente centrada en cero, y las diferencias emparejadas entre control y tratamiento mostraron una concentración aún mayor alrededor de cero, indicando que las estimaciones pareadas para A/B son confiables.

Rendimiento e implementación práctica: XLM-RoBERTa-large ofreció un buen balance entre calidad y eficiencia de inferencia, permitiendo etiquetar 150000 filas en unos 30 minutos con una GPU A10G. Modelos más grandes como Llama-3–8B mejoran ligeramente la precisión pero incrementan seis veces el tiempo y coste de inferencia, por lo que la elección del backbone debe ponderar calidad y coste operacional.

Soporte multilingüe: aunque la mayor parte de los datos de entrenamiento eran en inglés, la adaptación multilingüe mostró buenos resultados en mercados como Francia y Alemania con correlaciones de rango aceptables y distribución de errores centrada en cero, lo que permite extender la evaluación de relevancia a otros idiomas y reducir aún más costes al ampliar la cobertura geográfica.

Conclusiones y beneficios: la transición a una evaluación de relevancia basada en LLMs permite escalar los conjuntos de consulta, rediseñar el muestreo y mejorar la sensibilidad experimental reduciendo los MDEs en orden de magnitud. Se redujeron costes y tiempos de anotación y se mantuvo un sesgo medio bajo en métricas clave, lo que facilita detectar cambios finos en relevancia y acelerar el ciclo de despliegue de mejoras en búsqueda.

Futuro: exploraremos modelos visuales-lingüísticos VLM para aprovechar la señal visual cruda en la predicción de relevancia y trabajaremos en cerrar la brecha de rendimiento en consultas no inglesas mejorando las capacidades multilingües del modelo.

Sobre Q2BSTUDIO: en Q2BSTUDIO somos una empresa de desarrollo de software especializada en aplicaciones a medida y software a medida, con experiencia en inteligencia artificial, ciberseguridad y servicios cloud aws y azure. Ofrecemos soluciones integrales que incluyen servicios de inteligencia de negocio y Power BI, agentes IA y desarrollos personalizados que ayudan a las empresas a transformar datos en valor. Si su organización necesita una solución a medida para búsqueda, recomendación o análisis, podemos ayudarle a diseñar e implementar modelos de IA escalables y pipelines seguros. Conozca nuestras propuestas de aplicaciones a medida visitando aplicaciones a medida y software a medida y descubra nuestros servicios de inteligencia artificial para empresas en ia para empresas e inteligencia artificial.

Palabras clave: aplicaciones a medida, software a medida, inteligencia artificial, ciberseguridad, servicios cloud aws y azure, servicios inteligencia de negocio, ia para empresas, agentes IA, power bi.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.