Multiverse Computing presentó su estudio «¿Seguridad para quién? Autodestilación consciente de los límites para un rechazo de seguridad controlado de los LLM» el 8 de septiembre de 2026. La investigación aborda un problema práctico para los modelos de lenguaje desplegados: cuándo una política de rechazo mejora la seguridad y cuándo empieza a denegar solicitudes que deberían recibir una respuesta.

El análisis utiliza los prompts políticos para separar dos casos que pueden parecerse en su formulación. Por un lado están las solicitudes dañinas, como la persuasión o manipulación política dirigida; por otro, las peticiones benignas de información política factual. Un sistema puede fallar en ambas direcciones: responder a un prompt peligroso o rechazar uno legítimo porque contiene señales parecidas.

La cobertura de los datos modifica el entrenamiento

En el conjunto analizado, una generación de una sola pasada abandonó el 19,88 % de los prompts, equivalentes a 8.009 elementos, porque no produjo un rechazo válido. Una estrategia de reintento, con un guiado progresivamente más intenso, redujo los fallos restantes al 0,20 %, o 79 prompts.

El proceso de reparación de cobertura conservó además 40.293 prompts dañinos para el entrenamiento que un proceso ingenuo habría descartado. La cifra importa porque los ejemplos más difíciles también forman parte del límite que el modelo debe aprender a reconocer. Si desaparecen cuando falla la generación del rechazo, el conjunto de datos deja de representar precisamente algunos de los casos de riesgo más problemáticos.

Los investigadores incorporaron también 11.955 prompts benignos verificados con una apariencia peligrosa, distribuidos en 18 tipos semánticos. Para comprobar el resultado utilizaron material separado y reservado: 1.539 pares de prompts dañinos y 1.539 pares benignos. La presencia de ambos grupos permite evaluar si el modelo distingue entre una formulación sospechosa y la intención que hay detrás.

La seguridad mejora, pero el rechazo excesivo se dispara

En Qwen3-8B, el modelo con cobertura mejorada elevó del 9,47 % al 84,75 % la tasa de rechazo político dentro de la distribución. En la configuración más intensa, la tasa media de respuestas peligrosas en HarmBench, StrongREJECT y WildJailbreak cayó del 26,26 % al 0,14 %, con LlamaGuard-3 como sistema de evaluación.

El coste aparece en XSTest. En el mismo checkpoint, el rechazo excesivo pasó del 2,00 % al 74,00 %. Por tanto, una mayor frecuencia de negativas no basta para describir un sistema como más seguro para todos sus usuarios: también puede impedir el acceso a información solicitada de forma legítima.

La incorporación de datos benignos situados en ese límite recuperó parte de la usabilidad. El rechazo excesivo de los prompts que debían recibir una respuesta bajó del 32,94 % al 4,16 %, mientras que el rechazo en el lado dañino pasó del 91,88 % al 87,72 %. El equilibrio mejora, aunque la protección frente a las solicitudes dañinas ya no alcanza el nivel de la configuración más restrictiva.

Un resultado útil para medir el compromiso

Los datos respaldan un proceso de entrenamiento y evaluación que mida los dos lados del límite. Los prompts benignos parecidos a otros dañinos deben permanecer en los conjuntos de entrenamiento y de prueba; de lo contrario, una reducción de las respuestas peligrosas puede ocultar un sistema demasiado difícil de utilizar para peticiones seguras.

El alcance del resultado está acotado por la configuración estudiada: Qwen3-8B, el caso de la persuasión política, los conjuntos de evaluación citados y LlamaGuard-3 como evaluador. No permite concluir que el mismo equilibrio se mantenga con todos los modelos, políticas o benchmarks de seguridad.

La aportación práctica del estudio es metodológica. Una cobertura más amplia puede reducir las respuestas peligrosas, pero también aumentar de forma considerable los rechazos indebidos; los ejemplos benignos cercanos al límite ayudan a recuperar parte de esa usabilidad. El compromiso no desaparece: la diferencia está en medirlo junto con la seguridad, en lugar de usar el volumen de rechazos como único objetivo.

Fuentes oficiales

Fuentes y metodología

  1. Official source: huggingface.co Abre una fuente externa