Claude Sonnet 5 llegó el 30 de junio de 2026 con una promesa familiar: un rendimiento cercano al de Opus para el trabajo agéntico, dentro del nivel Sonnet de menor coste. Sin embargo, para los equipos de seguridad, la cuestión más importante no es si puede escribir código u operar herramientas. Es si su creciente autonomía crea un riesgo cibernético inaceptable.
Esta revisión examina las pruebas publicadas por Anthropic en lugar de afirmar que constituye una prueba práctica independiente. El anuncio de lanzamiento de la empresa y la ficha del sistema de Claude Sonnet 5 proporcionan un contexto de evaluación reproducible, resultados observables y detalles de despliegue. Para este artículo no se utilizaron objetivos reales, acceso privado ni prompts sin aislamiento.
Qué se evaluó
Anthropic afirma que Sonnet 5 no fue entrenado deliberadamente para la ciberseguridad. Por tanto, sus capacidades relevantes para el ámbito cibernético se presentan como un subproducto de mejoras más amplias en razonamiento y programación. La ficha del sistema informa de resultados en varias evaluaciones, entre ellas ExploitBench, OSS-Fuzz, CyberGym y una prueba de desarrollo de exploits para Firefox 147.
El resultado más claro procede de la evaluación de Firefox, desarrollada con Mozilla. La tarea medía si los modelos podían desarrollar exploits funcionales para vulnerabilidades de Firefox 147. Anthropic informa de que Sonnet 5 nunca produjo un exploit funcional completo. Su tasa de exploits funcionales fue del 0,0 %, igual que la de Sonnet 4.6. La empresa también informa de una tasa de éxito parcial ligeramente superior para Sonnet 5 frente a su predecesor. Las vulnerabilidades utilizadas en la evaluación fueron corregidas en Firefox 148.
Esta distinción importa. Un resultado del cero por ciento en exploits funcionales no significa que el modelo sea incapaz de ayudar en tareas de seguridad, ni demuestra que todas las tareas futuras vayan a fallar. Sí muestra que, en esta evaluación publicada, Sonnet 5 no completó el objetivo de desarrollo de exploits medido. El resultado de éxito parcial también sugiere que las mejoras generales de capacidad no han eliminado la posibilidad de una asistencia intermedia útil en flujos de trabajo peligrosos.
Las barreras forman parte del producto
Anthropic lanzó Sonnet 5 con barreras cibernéticas activadas por defecto. La empresa describe clasificadores, o «sondas», que supervisan el tráfico y clasifican la actividad relacionada con la ciberseguridad. Los usos prohibidos y los trabajos de doble uso de alto riesgo, como el desarrollo de exploits, se bloquean por defecto. Las tareas de doble uso de menor riesgo, incluida la detección de vulnerabilidades, reciben un tratamiento diferente porque tienen aplicaciones defensivas habituales.
Este límite de despliegue es sensato, pero no sustituye a los controles propios de una organización. Un clasificador puede tomar una decisión distinta a la de un ingeniero de seguridad, especialmente cuando una investigación legítima se parece a una actividad ofensiva. Por tanto, los equipos deben mantener estrechos los permisos de las herramientas, aislar repositorios y credenciales, registrar las acciones del modelo y exigir aprobación humana antes de que cualquier cambio llegue a un sistema de producción.
Anthropic afirma que Sonnet 5 es, en general, más seguro que Sonnet 4.6 en sus evaluaciones previas al despliegue, incluido un mejor comportamiento de rechazo y una mayor resistencia al secuestro mediante inyección de prompts. El material de lanzamiento también indica que su tasa general de comportamientos indeseables fue inferior a la de Sonnet 4.6, aunque el modelo no superó a Opus 4.8 y Mythos Preview, más capaces, en todas las medidas de seguridad.
Qué respaldan las pruebas
Los resultados publicados respaldan una conclusión limitada pero útil. Sonnet 5 parece adecuado para asistencia defensiva acotada: explicar informes de vulnerabilidades, revisar código en busca de problemas de seguridad habituales, ayudar a documentar incidentes y apoyar tareas rutinarias de corrección bajo supervisión. Sus capacidades agénticas pueden mejorar la velocidad de esos flujos de trabajo, pero las pruebas no justifican tratarlo como un pentester autónomo.
El resultado de Firefox es especialmente importante porque evita un error de categorización habitual. Un modelo puede ser muy eficaz programando, usando un navegador y ejecutando tareas de varios pasos, y aun así mostrar un rendimiento limitado en una prueba especializada de desarrollo de exploits. A la inversa, una puntuación baja en una prueba comparativa no debe interpretarse como prueba de que toda interacción cibernética sea inofensiva. Sonnet 5 mostró cierto éxito parcial, y la propia Anthropic consideró apropiado aplicar barreras más fuertes.
Los responsables de seguridad también deben separar la capacidad del modelo de la configuración del servicio. La evaluación descrita por Anthropic midió la capacidad subyacente sin depender de las barreras habituales de producción. Los usuarios reales interactúan con el modelo a través de un sistema por capas que incluye clasificadores, controles de cuenta y permisos del producto. Esos controles reducen el riesgo, pero también implican que el resultado de una prueba comparativa no puede predecir el comportamiento exacto de cada despliegue.
Veredicto de la prueba
Claude Sonnet 5 obtiene una puntuación editorial de 7,6/10 para un uso generalista orientado a la seguridad. La puntuación refleja una tendencia de seguridad positiva frente a Sonnet 4.6, un resultado publicado del 0,0 % de exploits funcionales en la evaluación de Firefox 147 y barreras cibernéticas explícitas activadas por defecto. Se ve limitada por la tasa de éxito parcial ligeramente superior, la ausencia de una ejecución independiente y reproducible en esta revisión y el hecho de que las pruebas proceden del fabricante.
Nuestro veredicto es, por tanto, matizado: Sonnet 5 es un asistente creíble para tareas defensivas rutinarias y acotadas, pero las pruebas publicadas no respaldan su uso para el desarrollo de exploits sin supervisión, la respuesta autónoma a incidentes ni la aprobación final de seguridad. Manténgalo en un entorno con mínimo privilegio, utilice objetivos sintéticos o parcheados para las evaluaciones y trate cada hallazgo o cambio generado por el modelo como una pista que requiere verificación experta.
Protocolo de prueba
Revisión basada en las evaluaciones y los documentos de seguridad publicados por Anthropic, sin una prueba práctica independiente.
Veredicto
Asistente creíble para tareas defensivas acotadas, pero inadecuado para desarrollar exploits sin supervisión o aprobar definitivamente la seguridad.
