Cuando el robot humanoide se enfrenta a terrenos complejos como pilas de ciruela, puentes rotos y escaleras de banda estrecha, la prueba que realmente se extiende frente a él es mucho más simple que "ver claramente los pies".
En el terreno plano continuo, generalmente hay espacio para el ajuste de un asentamiento inexacto a la vez; Pero en áreas de aterrizaje escasas, discretas y geométricamente limitadas, las plantas de los pies pueden pisarse en el aire con un desplazamiento de unos centímetros. Una vez que el robot toma una decisión equivocada en un instante, a menudo el cuerpo ha perdido el equilibrio antes de que pueda ajustarse.
¿De ahí surge una pregunta clave: ¿ pueden los robots juzgar con antelación hacia qué futuro se llevará este paso antes de dar el paso actual?
Para resolver este problema, el equipo de algoritmos de robots de batata propuso World Model augmented visual location, conocido como WM - loco.
WM - Loco introdujo el modelo mundial orientado a la predicción de futuros Estados visuales y de movimiento en la caminata de terreno complejo de robots humanoides, realizó un entrenamiento conjunto de extremo a extremo en la simulación y realizó la migración de máquinas reales Zero - shot. Esto significa que las estrategias entrenadas en la simulación se pueden desplegar directamente en robots físicos sin ajustes secundarios.
Mapa de arquitectura WM - loco: estrategia PPO a la izquierda y modelo de mundo circular a la derecha, los dos comparten codificadores, entrenamiento conjunto de extremo a extremo
En pocas palabras, los robots del pasado se basaban más en lo que "se veía" para decidir el siguiente paso; WM - loco, por su parte, permitió a los robots aprender a "predecir el futuro primero y luego decidir qué hacer a continuación".
¿I. solo entiendo el pasado, ¿ por qué no es suficiente?
El aprendizaje tradicional de refuerzo visual generalmente introduce la información visual actual e histórica en la red de estrategias junto con el Estado ontológico del robot, y luego emite instrucciones de control conjunto en tiempo real.
Este tipo de estrategia basada en la historia de observación, que permite "ver" la información que el robot ha experimentado, puede juzgar cómo el robot se movía anteriormente, cómo el terreno cambiaba y generar la acción actual introduciendo imágenes multifotogramas consecutivas o un historial de Estado ontológico.
Pero el problema es que la estrategia utiliza información siempre "pasada" y no aprende explícitamente "los cambios de Estado futuros que una acción puede traer". Esta limitación no es obvia en el terreno plano y el terreno regular, pero una vez que se enfrenta a este terreno estrictamente limitado en la zona de aterrizaje, como pilas de ciruela, puentes rotos y escaleras de banda estrecha, las deficiencias de la toma de decisiones basadas en la historia de la observación se amplifican drásticamente.
Debido a la caminata topográfica compleja, nunca ha sido una simple superposición de una serie de movimientos de un solo paso no relacionados entre sí.
Donde se pisa este pie en la actualidad, seguirá afectando el Centro de gravedad del cuerpo, la relación de apoyo, la trayectoria de las piernas oscilantes y a qué áreas se puede llegar a continuación. Una acción aparentemente factible en este momento puede dejar al Robot en un Estado sin camino en el siguiente momento.
¿Por lo tanto, los robots no solo necesitan entender "lo que sucedió antes", sino también predecir: ¿ qué puede pasar después si se realiza esta acción?
2. poner una comprensión del "futuro" en la Estrategia
WM - Loco recibe simultáneamente información de visión profunda aerotransportada y percepción ontológica del robot, y a través de un modelo de mundo circular, continúa aprendiendo la relación dinámica entre el robot, la acción y el medio ambiente en el espacio oculto.
Cabe destacar que el propósito de este modelo mundial no es generar un video futuro para que la gente lo vea, sino aprender una representación más compacta y adecuada del Estado futuro para el control en tiempo real. WM - Loco intenta responder tres preguntas en cada momento:
¿¿ en qué Estado están ahora los robots y el terreno?
¿¿ cómo cambiarán los Estados visuales y físicos después de realizar los movimientos?
¿¿ este cambio favorece la próxima caminata estable?
En la implementación específica, el modelo mundial se compone de una trayectoria de memoria determinada y una variable implícita aleatoria: la primera acumula historia a lo largo del ciclo temporal y la segunda se deduce de las observaciones actuales.
A través de la reconstrucción de la observación de aprendizaje, la transferencia de Estado potencial y la predicción de retroalimentación de tareas, el modelo mundial refina gradualmente la caracterización dinámica que contiene tendencias de movimiento futuras y devuelve esta información a la estrategia ppo.
Como resultado, la estrategia ya no solo obtiene escalones, obstáculos y áreas de aterrizaje en la imagen de profundidad actual, ni solo una trayectoria de movimiento histórico, sino que también contiene información prospectiva sobre cómo el estado físico del robot puede evolucionar a continuación.
GT es la profundidad real del siguiente cuadro, recon. es la predicción del modelo y error es el error por píxeles
Esta es la diferencia central entre WM - loco y la estrategia normal de entrada de múltiples cuadros. Observar la historia ayuda principalmente a la estrategia a comprender "lo que sucedió en el pasado"; El modelo mundial, por su parte, aprende más sobre las relaciones dinámicas entre las observaciones, los movimientos y los Estados futuros, lo que permite a las estrategias deducir "lo que puede pasar después".
Como resultado, la toma de decisiones de la estrategia ya no depende solo de la información histórica, sino que realmente tiene la capacidad de predicción orientada al futuro.
3. entrenamiento de extremo a extremo, adiós al engorroso proceso
Para que el robot pase por un terreno complejo, muchas rutas técnicas dividirán el sistema en varios módulos, como percepción, planificación de puntos de apoyo, generación de trayectorias, estrategia docente y control subyacente.
Algunos programas también requieren entrenar primero una estrategia docente "abierta" con la verdad topográfica completa, y luego migrar la capacidad a una estrategia estudiantil que utiliza sensores aerotransportados a través de la destilación del conocimiento. El costo de este tipo de esquemas es que el enlace de entrenamiento es más largo, el diseño manual es más, el costo de construcción de datos es más alto, y el error entre múltiples módulos puede transmitirse paso a paso y amplificarse capa por capa.
Por el contrario, WM - Loco eligió un camino más directo y conciso: el modelo mundial y la estrategia de caminar se optimizan conjuntamente de extremo a extremo en el mismo proceso de entrenamiento.
Todo el sistema no necesita marcar manualmente el punto de apoyo, no depende de la trayectoria del pie planificada de antemano, no necesita destilar en varias etapas de profesor a estudiante, no necesita una estructura compleja de múltiples expertos y no necesita entrenar múltiples módulos independientes por separado. Desde la entrada visual hasta los movimientos articulares, el entrenamiento está en su lugar en un solo paso.
La información dinámica aprendida por el modelo mundial tampoco se reconstruye para la reconstrucción, sino que sirve directamente a un objetivo: ayudar a las estrategias a tomar mejores decisiones a continuación.
IV. mayor tasa de éxito y marcha más natural
Bajo la misma entrada visual y configuración de tareas, el equipo algorítmico comparó WM - loco con la estrategia PPO de base.
A medida que la zona de aterrizaje se vuelve cada vez más escasa, estrecha y discontinua, los dos métodos muestran una clara brecha. Las estrategias de PPO puras que solo dependen de la observación de la historia son más propensas a problemas de asentamiento prematuro, exploraciones frecuentes, ritmos inconsistentes entre las piernas izquierda y derecha, y movimientos locales factibles, pero no continuables en el seguimiento. En algunos terrenos difíciles, el PPO simple es incluso difícil de formar una capacidad de paso estable.
Después de la introducción del modelo mundial, la tasa de éxito del robot en escenarios complejos como pilas de ciruela, puentes rotos, escaleras de banda estrecha y puentes de madera única ha mejorado significativamente, acercándose al 100% en la simulación. Al mismo tiempo, el robot reduce la corrección abrupta y la marcha vacilante.
En otras palabras, el modelo del mundo trae no solo "poder caminar", sino también hacer que el robot muestre intenciones de movimiento más continuas y estables al caminar: balancear las piernas, asentarse y cambiar el Centro de gravedad del cuerpo son más consistentes, el ritmo de las piernas izquierda y derecha es más coordinado, y el movimiento general es más natural y más cercano a la caminata humana.
En el avión real, el mismo conjunto de pesos se desplegó en Zero - shot a unitee g1: se probaron 10 veces cada uno de los tres tipos de terreno: pisar piedras, escalones y grietas, con una tasa media de éxito del 93,3%. Entre ellos, una brecha de 0,8 metros de ancho, el robot cruzó paso a paso con una acción completa de "balanceo de piernas - Salto - aterrizaje" - por razones de seguridad, el equipo no continuó probando una brecha más amplia, pero esta es ya una distancia de salto de máquina real rara en el trabajo público actual.
V. verificación in situ de la máquina real: no solo Demo
El trabajo en el mercado generalmente muestra videos demo seleccionados, lo que a menudo es difícil de reflejar completamente la estabilidad del algoritmo en el entorno real.
La exhibición en vivo es completamente diferente. El Robot necesita enfrentar el ruido real del sensor, los cambios en el Estado del equipo, la interferencia de la luz y la operación única que no se puede volver. Cualquier error de percepción o control se expondrá directamente al espectador.
En la reciente reunión de comunicación de medios Sunrise s600, el robot humanoide con WM - Loco completó la exhibición pública de la máquina real en el lugar. El algoritmo funciona en tiempo real en robots reales, sensores reales y plataformas de computación Sunrise s600, completando un circuito cerrado completo desde la percepción visual, el modelado del mundo hasta el control de movimiento de todo el cuerpo.
En comparación con las demostraciones de caminata de terreno complejo con videodemo como forma principal de exhibición, la operación abierta en el sitio plantea mayores requisitos para la estabilidad, el tiempo real y la fiabilidad del despliegue del algoritmo, lo que verifica aún más la fiabilidad de ingeniería, la desplegabilidad real y la alta tasa de éxito de WM - loco.
El modelo mundial no solo se utiliza para generar el futuro, sino que también puede ayudar a los robots a entender el futuro.
A medida que el robot pasa de tomar decisiones basadas en la historia de la observación a predecir activamente las consecuencias de la acción, su lógica de caminar también cambia: predecir el futuro primero y luego dar el siguiente paso.
(extracto)