Skild AI afirma que su modelo S1 puede enseñar a un robot una tarea desconocida y de larga duración a partir de una sola demostración en vídeo. En una publicación de NVIDIA del 10 de septiembre de 2026, el sistema se describe como un modelo fundacional de robótica que utiliza el vídeo como indicación, sin actualizar sus pesos ni someterse a un postentrenamiento específico para la tarea.
La demostración funciona como instrucción
El flujo de trabajo comienza cuando un operador graba la tarea que quiere realizar y proporciona ese vídeo a S1. El modelo interpreta la intención demostrada, los objetos y la secuencia, y convierte esa información en acciones para el robot. Skild AI sostiene que el sistema puede ejecutar tareas ausentes de su preentrenamiento sin volver a entrenarse para cada una, porque la conducta se proporciona en contexto. NVIDIA denomina aprendizaje en contexto a este enfoque.
La diferencia está en el modo de transferir una instrucción a un sistema físico. El procedimiento descrito sustituye, para cada tarea nueva, el inicio de un ciclo de entrenamiento específico por una demostración que el modelo utiliza en el momento de la ejecución. Eso puede simplificar la incorporación de procedimientos nuevos, aunque la afirmación se refiere a cómo S1 recibe y utiliza la información: no garantiza una ejecución perfecta en cualquier entorno.
Qué resultados comunica la compañía
NVIDIA afirma que S1 puede ejecutar tareas desconocidas de hasta 10 minutos de duración. Entre los ejemplos incluidos en la publicación aparecen trasplantar una planta, preparar tortitas, hacer café de filtro y montar kits. En una prueba de trasplante, Skild AI pasó de grabar la demostración a ejecutar la tarea de forma autónoma en hardware en 11 minutos.
En pruebas de varios pasos con tareas nuevas, S1 completó alrededor del 66 % de los pasos, frente al 9 % de un sistema de IA similar. NVIDIA presenta la diferencia como una mejora de más de siete veces. La métrica mide el éxito de cada paso dentro de las secuencias probadas; por eso permite comparar ese conjunto de evaluaciones, pero no equivale a una tasa de éxito universal para cualquier trabajo robótico.
Skild AI también calcula que un breve ejemplo en vídeo puede ser tan útil como unos 380 ejemplos prácticos de entrenamiento. Según la empresa, recopilar esos ejemplos manualmente podría requerir entre 50 y 100 horas. Son estimaciones de Skild AI sobre la recopilación de datos, no un ahorro garantizado en todos los despliegues ni una medida independiente del coste total de poner el sistema en funcionamiento.
El modelo llega con actividad comercial
El lanzamiento se sitúa dentro de una operación comercial que Skild AI ya había presentado como activa. En ese momento, la empresa afirmó haber alcanzado una tasa de ingresos anualizada de 100 millones de dólares, 10 meses después de su primer despliegue comercial. También dijo contar con más de 60 alianzas de despliegue en fabricación, logística, inspección, seguridad y preparación de alimentos, entre otras aplicaciones.
Esas alianzas aportan contexto al anuncio: S1 no se presenta únicamente como una demostración de laboratorio, sino junto a despliegues industriales y de servicios. Aun así, el número de alianzas y la tasa de ingresos son datos comunicados por la propia compañía. No describen por sí solos el rendimiento de cada instalación ni permiten extrapolar los resultados de las pruebas a todos los sectores mencionados.
En otro ejemplo de fabricación, Skild AI, NVIDIA y Foxconn están desplegando Skild Brain en manipuladores de dos brazos para el ensamblaje de precisión de sistemas NVIDIA Blackwell. En el flujo mostrado por NVIDIA, el robot instala una barra colectora y un limitador, aprieta 16 tornillos y se adapta a perturbaciones durante una tarea de varios pasos. El ejemplo muestra la coordinación física que buscan las empresas, pero está descrito como un despliegue de Skild Brain, no como una prueba independiente de S1.
El siguiente límite depende de los acuerdos de datos
Skild AI afirma que la experiencia obtenida en despliegues comerciales puede alimentar su modelo general cuando los acuerdos con los clientes lo permiten. Los permisos de uso de datos forman parte del modelo operativo: el ciclo de aprendizaje puede prolongarse más allá de la demostración inicial, pero solo cuando esos acuerdos lo autorizan.
El cambio comunicado por S1 consiste en utilizar demostraciones en vídeo como instrucciones inmediatas para tareas que antes podían exigir un reentrenamiento específico. Los resultados publicados, los ejemplos de uso y la actividad comercial respaldan un avance relevante en la IA física, pero no la conclusión de que un robot pueda aprender cualquier trabajo a partir de cualquier vídeo. La utilidad real dependerá de las tareas probadas, del entorno y de los datos que puedan incorporarse con autorización.
