✨︎ Resumen (TL;DR):
- OpenWAM se preentrenó con unas 14,640 horas de video y probó varias formas de ordenar la predicción y la acción.
- En LIBERO-Long, una variante pasó de 68.4% a 97.8% de éxito al incorporar dos cambios juntos.
- AutodidactWAM llevó la tarea completa a 30% con un juguete antiestrés rosa, pero mantuvo 10% con una pelota azul.
El equipo de Stanford detrás de OpenWAM y el equipo de Sergei Kurchev detrás de AutodidactWAM depositaron sus preprints en arXiv el 6 de octubre de 2026 para probar dos formas de convertir video en acciones para robots. OpenWAM aprende con 14,640 horas de video y compara distintas formas de unir predicción visual y control; AutodidactWAM corrige movimientos de un Unitree G1 usando la postura de las manos en video generado. Sus tasas de éxito cambian según la tarea, el robot y el protocolo.
Ambos trabajos estudian los modelos de mundo y acción, conocidos como WAM. Un modelo de mundo y acción (WAM) es un sistema de IA que predice imágenes futuras y produce instrucciones de movimiento. Una secuencia puede representar cómo un robot recoge un objeto, pero ejecutar esa recogida exige que las acciones correspondan a su posición, sus articulaciones y el contacto con el objeto.

OpenWAM compara el orden entre video y movimiento
El equipo de Stanford construyó OpenWAM sobre Wan2.2-5B. Según la página del proyecto, el preentrenamiento utilizó unas 14,640 horas de video, con grabaciones reales, simulaciones e interacciones humanas. Esa fase empleó video sin etiquetas de acciones y después incorporó un componente especializado en acciones.
El marco permite generar primero el video y después los movimientos, invertir ese orden o producir ambas salidas con otras configuraciones. Así, los investigadores comparan esas decisiones sobre una base común.
En LIBERO-Long, una prueba de manipulación en simulación, la variante que predice el video antes de actuar pasó de 68.4% a 97.8% de éxito al incorporar el preentrenamiento robótico y la adaptación causal. La diferencia fue de 29.4 puntos porcentuales.
Los dos cambios se introdujeron juntos. Por eso, esa comparación mide su efecto combinado y no el aporte aislado de cada cambio.
OpenWAM también pasó por robots físicos
OpenWAM también se evaluó con dos brazos Franka Research 3. La variante promedió 92.1% de éxito en tres tareas físicas. Las pruebas se repartieron así:
- Tostar pan: 50 intentos.
- Completar la última capa de un cubo de Rubik de 2 × 2: 50 intentos.
- Ordenar vasos por color: 36 intentos.
Otro experimento reutilizó un componente que convierte predicciones visuales en acciones y llegó a 84.0% en cuatro tareas nuevas de LIBERO. En ese caso, el predictor de video se adaptó con demostraciones de las tareas de destino que incluían etiquetas de acciones.
AutodidactWAM corrige movimientos desde video generado
El equipo de Sergei Kurchev adaptó Cosmos 3 a un Unitree G1 con manos BrainCo. Aunque el video representaba ejecuciones plausibles, las acciones originales completaban la tarea de recoger y colocar un objeto en aproximadamente 7% de los intentos, en promedio.
AutodidactWAM extrae la postura de las manos del video y la convierte en objetivos de movimiento mediante cinemática inversa. Esa extracción alcanzó cerca de 42% de éxito completo antes de trasladar la corrección al modelo.
El mejor ajuste combinó aprendizaje basado en preferencias, aprendizaje supervisado y ajuste de trayectoria, bajo la fórmula DPO+SFT+DTW. La tabla I del preprint registra 20 intentos por objeto y condición. Oreo fue el objeto usado para entrenar la corrección.
| Objeto | Acciones originales | DPO+SFT+DTW |
|---|---|---|
| Oreo | 0% | 20% |
| Juguete antiestrés rosa | 10% | 30% |
| Pelota azul | 10% | 10% |
Dos métricas distintas para un mismo problema
Los porcentajes de ambos trabajos no son comparables de forma directa. OpenWAM y AutodidactWAM usaron robots, tareas y protocolos distintos.
Leídos juntos, los experimentos separan dos avances concretos: aprender predicciones visuales útiles y convertirlas en movimientos ejecutables. OpenWAM compara cómo organizar esa predicción y el control; AutodidactWAM corrige la trayectoria a partir de la postura de las manos.
En el piloto del humanoide, la corrección mejoró la tarea completa con Oreo y el juguete antiestrés rosa, pero la pelota azul se mantuvo en 10%, igual que el resultado inicial. El ajuste ayudó con dos objetos y no cambió el resultado del tercero.