NVIDIA anunció el 11 de agosto de 2026 Nemotron 3.5 Lightning y NeMo Switchyard, dos herramientas destinadas a gestionar cargas de trabajo agénticas de larga duración. Nemotron genera las respuestas, mientras Switchyard decide qué modelo debe atender cada solicitud dentro de un flujo de trabajo.
Un modelo abierto para tareas agénticas
Nemotron 3.5 Lightning es un modelo de mezcla de expertos con 30.000 millones de parámetros. NVIDIA afirma que ofrece una velocidad de generación hasta cuatro veces superior a la de otros modelos de su categoría y que reduce un 30 % el tiempo necesario para completar tareas agénticas.
Estas cifras proceden de comparaciones internas de NVIDIA. Describen el rendimiento observado en las pruebas de la compañía, pero no garantizan el mismo resultado con cualquier aplicación, conjunto de datos o configuración.
La otra pieza es NeMo Switchyard, una capa de enrutamiento independiente que puede enviar cada solicitud al modelo más adecuado dentro de un conjunto de modelos abiertos, propietarios y de NVIDIA. Los desarrolladores pueden ajustar sus reglas según la calidad, la latencia y el coste. NVIDIA afirma además que las aplicaciones existentes no necesitan reescribirse para utilizar la biblioteca.
CrowdStrike aparece entre los casos de uso citados
El anuncio menciona a CrowdStrike entre las organizaciones que están adaptando Nemotron 3.5 Lightning. NVIDIA también cita a Harvey con Trajectory para servicios jurídicos y a CodeRabbit con Baseten para la revisión de código.
La mención de CrowdStrike apunta a un uso dentro de flujos de trabajo especializados de ciberseguridad, en lugar de limitar el modelo a una interfaz de propósito general. Sin embargo, NVIDIA no detalla qué sistema ha desplegado CrowdStrike, qué tareas cubre ni qué controles de seguridad aplica. Por eso, el caso ilustra el tipo de entorno al que se dirige la herramienta, pero no permite medir por sí solo su rendimiento en producción.
NVIDIA sostiene que las organizaciones pueden posentrenar Nemotron 3.5 Lightning con NeMo utilizando sus propios datos, herramientas y flujos de trabajo. Esa opción permitiría adaptar el modelo a patrones operativos internos, aunque cada equipo tendría que comprobar la calidad obtenida y definir las salvaguardas adecuadas para sus tareas.
El ahorro depende de la política de enrutamiento
Según las pruebas internas de NVIDIA, NeMo Switchyard puede mantener una precisión de nivel frontera y reducir el coste de ejecución de una tarea hasta casi un tercio del coste de utilizar únicamente Opus 4.8. Los resultados compartidos por las organizaciones citadas en el anuncio muestran que el efecto cambia según la carga de trabajo y la política utilizada para distribuir las solicitudes.
Boomi comunicó una precisión del enrutamiento por dominio del 100 % en cinco capacidades de enrutamiento. La compañía envió el 59 % de su tráfico a un modelo ajustado que era cinco veces más rápido y redujo un 21 % la latencia de los turnos posteriores.
LangChain comunicó una reducción del 74 % en los costes de 145 tareas multi-turno de Deep Agents al enviar solo el 7 % de las llamadas a un modelo frontera. En ese caso, el ahorro estuvo acompañado de una caída del 6 % en precisión.
Ramp, por su parte, comunicó costes un 58 % menores y una ejecución un 33 % más rápida en Ramp SWE-Bench, igualando el rendimiento de un modelo frontera. Estas cifras pertenecen a las organizaciones citadas por NVIDIA y no deben interpretarse como resultados esperables en cualquier despliegue.
El compromiso es directo: enviar más solicitudes a modelos pequeños o ajustados puede reducir la latencia y el coste, pero también puede afectar a la calidad. La utilidad de Switchyard dependerá de las reglas definidas, de las tareas asignadas a cada modelo y de la forma en que cada equipo mida el resultado.
Disponibilidad para desarrolladores
Nemotron 3.5 Lightning está disponible a través de Hugging Face, ModelScope, OpenRouter y build.nvidia.com como microservicio NVIDIA NIM. NVIDIA afirma que puede ejecutarse localmente en PC NVIDIA RTX, DGX Spark, DGX Station y Jetson, además de en dispositivos periféricos, estaciones de trabajo NVIDIA RTX PRO, centros de datos y entornos de nube.
NeMo Switchyard está disponible en GitHub y NVIDIA espera que pronto sea compatible con plataformas asociadas. La compañía también ha publicado Nemotron-RL-Agentic-Terminal-Pivot, un conjunto de datos de aprendizaje por refuerzo agéntico utilizado para el posentrenamiento de capacidades de agentes de programación.
Para las organizaciones de ciberseguridad, el cambio inmediato es el acceso a un modelo abierto y a una capa de enrutamiento que pueden adaptar a sus datos, herramientas y flujos internos. La decisión práctica dependerá de si cada equipo puede validar con sus propias tareas la política de enrutamiento, la calidad del modelo y las salvaguardas necesarias.
NVIDIA presenta ambas herramientas como una infraestructura para asignar cada tarea de un agente al modelo más conveniente. Las mejoras comunicadas de velocidad y coste son relevantes, pero siguen vinculadas a las cargas de trabajo, las reglas de distribución y las pruebas concretas que sustentan cada resultado.
