Introducción: la relevancia en la búsqueda mide qué tan bien se alinean los resultados con la intención del usuario. En sistemas de búsqueda personalizados es clave presentar contenido pertinente a la necesidad informativa del usuario y no depender en exceso de interacciones pasadas. En Pinterest Search se mide la relevancia de página completa mediante experimentos A/B en línea para evaluar nuevos modelos de ranking y mantener una experiencia de alta calidad.
Resumen del enfoque: la medición tradicional depende de anotaciones humanas, pero la baja disponibilidad y el alto coste marginal de etiquetas humanas limitaban el tamaño muestral y la capacidad para detectar efectos heterogéneos o cambios pequeños en métricas principales. Para resolver estos cuellos de botella se desarrolló una metodología que escala el etiquetado mediante LLMs finamente ajustados con etiquetas humanas y se usan estos modelos para evaluar resultados de ranking entre grupos experimentales. Esto reduce costes y tiempos de etiquetado, permite ampliar conjuntos de consultas y refinar el diseño de muestreo, mejorando la calidad de la métrica.
Guía de relevancia y modelado: utilizamos una guía de 5 niveles para medir la relevancia semántica entre consulta y Pin: Altamente Relevante L5, Relevante L4, Marginalmente Relevante L3, Irrelevante L2 y Altamente Irrelevante L1. El modelo de relevancia se plantea como un problema de clasificación multiclase donde se minimiza la entropía cruzada punto a punto. La arquitectura empleada es un cross-encoder que toma en conjunto la consulta y la representación textual completa del Pin para predecir la etiqueta de relevancia con la mayor puntuación.
Representación de Pins: para representar cada Pin de forma robusta se combinan múltiples características textuales como título y descripción del Pin, leyendas generadas por BLIP, títulos y descripciones de la página enlazada, títulos de tableros donde se guardó el Pin y tokens de consulta con alta interacción asociados al Pin. Estas fuentes juntas crean una representación textual rica que mejora la precisión del juicio de relevancia.
Modelos y multilingüismo: se experimentó con modelos multilingües como multilingual BERT, T5, mDeBERTa, XLM-RoBERTa-large y Llama-3–8B. Se aprovechó la capacidad cross-lingual de modelos multilingües para soportar consultas y Pins en varios idiomas. Tras el ajuste fino se generan puntuaciones en 5 dimensiones y se selecciona la etiqueta por argmax para la evaluación.
Diseño de muestreo estratificado: el etiquetado con LLMs reduce costes y tiempos lo que permite diseños muestrales mucho mayores. Se propone un muestreo de consultas estratificado que posibilita medir efectos heterogéneos y reducir el mínimo efecto detectable MDE en un orden de magnitud. La estratificación asegura representatividad y cuando las estratas son relativamente homogéneas produce una reducción importante de la varianza. Para definir estratos se usa un modelo interno query-to-interest basado en DistilBERT combinado con un segmento de popularidad que mide el volumen de búsqueda de cada consulta.
Impacto en sensibilidad experimental: antes del etiquetado con LLMs los MDE eran elevados, por ejemplo 1.3 a 1.5 por ciento, debido a restricciones en el muestreo impuestas por el coste de anotación humana. Con LLMs se aumentaron los tamaños de muestra, se pasó del muestreo aleatorio simple a muestreo estratificado con estimador estratificado y asignación óptima de unidades por estrato. Así logramos reducir MDEs hasta torno a 0.25 por ciento. La mayor parte de la mejora proviene de la reducción de varianza gracias a la estratificación, consistente con hallazgos previos que muestran que la mayor variación en relevancia ocurre entre consultas.
Métrica sDCG@K y evaluación por pares: para evaluar el impacto de un experimento A/B en ranking tomamos una muestra estratificada de consultas emparejadas entre control y tratamiento, bloqueando diferencias entre consultas. Para cada consulta conservamos los top K resultados y generamos etiquetas LLM. Calculamos sDCG@K por consulta y agregamos métricas a nivel de consulta para derivar métricas topline. En esta configuración utilizamos K igual a 25. También calculamos efectos heterogéneos por popularidad e interés de la consulta y controlamos la tasa de falsos positivos con el procedimiento Benjamini-Hochberg.
Validación y alineamiento con etiquetas humanas: en validación se observó un alto alineamiento entre etiquetas generadas por LLM y anotadores humanos. A nivel de Pin la coincidencia exacta fue del 73.7 por ciento y el 91.7 por ciento de las veces la discrepancia fue como máximo de un punto en la escala de cinco niveles. A nivel de consulta se midieron correlaciones por rangos como Kendall y Spearman sobre sDCG@K y se observó robustez en segmentos de popularidad diversos. La distribución de errores en métricas a nivel de consulta estuvo fuertemente centrada en cero, y las diferencias emparejadas entre control y tratamiento mostraron una concentración aún mayor alrededor de cero, indicando que las estimaciones pareadas para A/B son confiables.
Rendimiento e implementación práctica: XLM-RoBERTa-large ofreció un buen balance entre calidad y eficiencia de inferencia, permitiendo etiquetar 150000 filas en unos 30 minutos con una GPU A10G. Modelos más grandes como Llama-3–8B mejoran ligeramente la precisión pero incrementan seis veces el tiempo y coste de inferencia, por lo que la elección del backbone debe ponderar calidad y coste operacional.
Soporte multilingüe: aunque la mayor parte de los datos de entrenamiento eran en inglés, la adaptación multilingüe mostró buenos resultados en mercados como Francia y Alemania con correlaciones de rango aceptables y distribución de errores centrada en cero, lo que permite extender la evaluación de relevancia a otros idiomas y reducir aún más costes al ampliar la cobertura geográfica.
Conclusiones y beneficios: la transición a una evaluación de relevancia basada en LLMs permite escalar los conjuntos de consulta, rediseñar el muestreo y mejorar la sensibilidad experimental reduciendo los MDEs en orden de magnitud. Se redujeron costes y tiempos de anotación y se mantuvo un sesgo medio bajo en métricas clave, lo que facilita detectar cambios finos en relevancia y acelerar el ciclo de despliegue de mejoras en búsqueda.
Futuro: exploraremos modelos visuales-lingüísticos VLM para aprovechar la señal visual cruda en la predicción de relevancia y trabajaremos en cerrar la brecha de rendimiento en consultas no inglesas mejorando las capacidades multilingües del modelo.
Sobre Q2BSTUDIO: en Q2BSTUDIO somos una empresa de desarrollo de software especializada en aplicaciones a medida y software a medida, con experiencia en inteligencia artificial, ciberseguridad y servicios cloud aws y azure. Ofrecemos soluciones integrales que incluyen servicios de inteligencia de negocio y Power BI, agentes IA y desarrollos personalizados que ayudan a las empresas a transformar datos en valor. Si su organización necesita una solución a medida para búsqueda, recomendación o análisis, podemos ayudarle a diseñar e implementar modelos de IA escalables y pipelines seguros. Conozca nuestras propuestas de aplicaciones a medida visitando aplicaciones a medida y software a medida y descubra nuestros servicios de inteligencia artificial para empresas en ia para empresas e inteligencia artificial.
Palabras clave: aplicaciones a medida, software a medida, inteligencia artificial, ciberseguridad, servicios cloud aws y azure, servicios inteligencia de negocio, ia para empresas, agentes IA, power bi.




