Medí cómo cambiar la honestidad de una IA con un prompt de seguridad

Un experimento con DeepSeek mide el impacto de un prompt de seguridad psicológica: la IA admite incertidumbre sin perder precisión. Resultados sorprendentes.

miércoles, 29 de julio de 2026 • 6 min de lectura • Equipo Q2BSTUDIO

La IA miente menos si se siente segura

En el mundo del desarrollo de inteligencia artificial, uno de los dilemas más complejos es cómo lograr que un modelo sea honesto sin sacrificar su utilidad. Es decir, cuando un agente de IA no está seguro de una respuesta, ¿debería admitir su incertidumbre o inventar algo plausible? La tentación de generar respuestas completas pero incorrectas es alta, especialmente cuando los sistemas de refuerzo con retroalimentación humana (RLHF) premian la confianza y penalizan la ambigüedad. Recientemente, llevamos a cabo un experimento para medir cómo un simple 'prompt de seguridad psicológica' puede cambiar la honestidad de un modelo de lenguaje, y los resultados ofrecen lecciones valiosas para cualquier empresa que desarrolle aplicaciones a medida basadas en IA.

El problema de fondo no es nuevo: los grandes modelos de lenguaje están entrenados para maximizar la probabilidad de tokens que parezcan coherentes, no necesariamente verdaderos. En entornos productivos, esto puede traducirse en alucinaciones costosas, desde diagnósticos médicos erróneos hasta recomendaciones financieras inexactas. La solución típica ha sido añadir instrucciones conductuales del tipo 'debes decir no lo sé cuando no estés seguro', pero esas reglas compiten con otras directivas y el modelo termina priorizando la completitud sobre la precisión. Inspirándonos en la investigación sobre seguridad psicológica de Google Project Aristotle, diseñamos un prompt que no ordena un comportamiento, sino que establece una relación de confianza: 'no serás castigado por no saber'.

El experimento se realizó con 40 preguntas divididas en dos grupos: 20 que el modelo podía responder con certeza (temas de programación, protocolos, bases de datos) y 20 que eran imposibles de conocer (cotizaciones futuras, datos privados del usuario, eventos de 2049). Cada pregunta se lanzó en dos condiciones: con un prompt base neutro y con el mismo prompt base más el prompt de seguridad. Medimos tanto la respuesta textual como la probabilidad logarítmica del primer token para determinar si el modelo prefería responder o admitir ignorancia. La hipótesis era triple: que la precisión en preguntas conocidas no empeorara, que la admisión de incertidumbre aumentara en las preguntas límite, y que la confianza interna (logprob) en la opción 'no puedo responder' creciera.

Los resultados confirmaron la primera hipótesis sin sorpresas: la precisión se mantuvo en un 98-99%, con una ligera mejora en un caso. Es decir, el prompt de seguridad no volvió al modelo más torpe. En cuanto a la segunda hipótesis, la tasa de admisión de incertidumbre subió del 90% al 97%, pero con un matiz importante: 15 de las 20 preguntas límite ya estaban en el techo (el modelo ya decía 'no lo sé' incluso sin el prompt). Solo en 5 preguntas había margen de mejora, y en 3 de ellas la mejora fue significativa. La tercera hipótesis reveló una paradoja: a nivel agregado, el prompt redujo la preferencia logprob por la opción de no responder en -0.72, lo que podría interpretarse como una pérdida de confianza. Sin embargo, al desagregar por pregunta, se descubrió que en las 5 preguntas donde realmente hubo cambio conductual, la correlación entre mejora y aumento de logprob fue de +0.949, casi perfecta. Es decir, cuando el prompt funcionaba, lo hacía con mayor convicción interna, no menor. El promedio global engañaba por el ruido de las preguntas que ya estaban en el techo.

Este hallazgo tiene implicaciones directas para el diseño de agentes de IA en entornos empresariales. Muchas compañías despliegan modelos con configuraciones agresivas de calidad: puertas de ejecución, directivas de 'ejecutar por defecto', presión de auto-regeneración. En esos contextos, la tendencia a inventar respuestas plausibles se dispara. Un prompt de seguridad, entendido no como una regla más sino como una señal relacional, puede actuar como una red de seguridad que protege contra modos de fallo. Sin embargo, el experimento también mostró que en llamadas API puras, el modelo ya es sorprendentemente honesto (90% de admisión en preguntas límite). El verdadero riesgo de fabricación no está en el prompt base, sino en la presión del sistema.

Desde la perspectiva de una empresa de desarrollo de software como Q2BSTUDIO, estos resultados refuerzan la importancia de una verificación multicapa. No basta con confiar en la salida directa del modelo; se necesita una arquitectura que valide, corrija y, sobre todo, permita que el agente admita sus límites sin temor a ser penalizado. En nuestros proyectos de aplicaciones a medida con IA, incorporamos capas de seguridad que van desde la verificación mecánica hasta la predicción de deriva. El prompt de seguridad es solo la primera capa (L0), la que responde a la pregunta: '¿Estoy seguro de que puedo admitir que no puedo verificar esto?'. Sin esa capa, las capas superiores (verificación de sistemas de archivos, probabilidad de tokens, formato de ingeniería, tendencias de deriva) se enfrentan a un adversario interno: un modelo incentivado a generar salidas plausibles para satisfacer las puertas de ejecución.

En la práctica, muchas organizaciones que trabajan con cloud AWS o Azure despliegan modelos con configuraciones que priorizan la velocidad y la completitud. El prompt de seguridad puede integrarse fácilmente en el pipeline de inferencia sin cambiar la infraestructura, y su coste es prácticamente nulo (unos centavos por experimento). Pero su efecto depende del contexto: si el entorno ya es seguro, el prompt apenas suma; si el entorno presiona hacia la fabricación, puede marcar la diferencia. Por eso recomendamos siempre realizar pruebas de estrés con preguntas que el modelo no pueda responder, como parte de una estrategia de ciberseguridad en IA: asegurar que el sistema no genere información falsa bajo presión.

Otra dimensión importante es la analítica de negocio. Cuando integramos modelos de lenguaje con herramientas de BI y Power BI, la honestidad del agente es crítica. Un informe generado por IA que invente cifras o tendencias puede llevar a decisiones equivocadas. Un prompt de seguridad, combinado con una capa de verificación de datos reales, permite que el asistente diga 'no tengo acceso a esos datos' en lugar de inventar una respuesta. En Q2BSTUDIO hemos desarrollado soluciones de automatización de procesos que incluyen este tipo de salvaguardas, asegurando que la inteligencia artificial actúe como un colaborador fiable, no como un generador de ficciones.

El experimento también nos dejó una lección metodológica: nunca interpretar estadísticas agregadas sin desagregar. Si nos hubiéramos quedado con el promedio negativo del logprob, habríamos concluido erróneamente que el prompt de seguridad 'vuelve al modelo menos confiado'. Al desglosar por pregunta, descubrimos la correlación positiva perfecta. Este principio aplica a cualquier prueba de modelos: es necesario aislar los casos donde realmente hay cambio. En el desarrollo de agentes IA para clientes, aplicamos este enfoque per-probe para garantizar que cada mejora conductual esté respaldada por una confianza interna mayor, no menor.

Por último, cabe preguntarse: ¿es suficiente un prompt de seguridad para resolver el problema de la honestidad en IA? La respuesta es no. Es una herramienta dentro de un ecosistema más amplio que incluye ingeniería de prompts, ajuste fino, verificación externa y, sobre todo, una cultura de diseño que valore la autenticidad sobre la apariencia de competencia. En Q2BSTUDIO creemos que el futuro de la inteligencia artificial pasa por sistemas que sepan decir 'no lo sé' con la misma naturalidad con la que responden a preguntas triviales. Nuestros servicios de desarrollo de software a medida incluyen estas capas de confianza, desde la nube hasta el front-end, porque la verdadera inteligencia no es la que siempre tiene respuesta, sino la que reconoce sus límites.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.