La mayoría de los lanzamientos de robótica pide que uno le crea a un video de demostración. Pollen Robotics, el equipo de robótica de Hugging Face con base en Burdeos, publica en cambio el bucle de entrenamiento completo.
Esta semana abrió la preventa de Microduck, un robot bípedo de 25 centímetros donde cada movimiento, caminar, sentarse, patear, andar en patines y levantarse tras una caída, es una política neuronal entrenada en un simulador de física y exportada al hardware. Cuesta 399 dólares. Los entornos de entrenamiento, las funciones de recompensa, los ajustes de aleatorización de dominio y la receta de simulación a realidad están todos públicos en GitHub.
Microduck sigue a Reachy Mini, que ya despachó más de 10.000 unidades, pero invierte su premisa: mientras Reachy Mini fue construido para quedarse sobre un escritorio e interactuar, Microduck fue construido para bajarse del escritorio, caerse y volver a pararse.
¿Qué trae por dentro el Microduck?

Microduck mide 25 centímetros de alto y 14 de ancho, y pesa menos de 800 gramos. Lleva 15 motores repartidos entre piernas, cuello y cabeza, más un pico articulado que levanta objetos del suelo. El cómputo corre sobre un Rockchip RK3566 con acelerador de IA, 1 GB de memoria RAM y 32 GB de almacenamiento.
El conjunto de sensores es inusualmente completo para el precio. Una cámara frontal se ubica detrás de un indicador dedicado de cámara en uso. Hay dos unidades de medición inercial, una en el cuerpo y otra en la cabeza. La medición de distancia corre por cuenta de un LiDAR compacto, una matriz de tiempo de vuelo de 8x8. Suma micrófonos y parlante, dos antenas NFC, además de Wi-Fi y Bluetooth. La alimentación es una batería removible NP-F550 de 2.600 mAh, suficiente para cerca de una hora.
Vienen siete movimientos entrenados de fábrica, manejables con un control de videojuegos incluido antes de escribir una sola línea de código: caminar, sentarse y pararse, patear, agarrar, andar en patines y auto recuperarse. El robot no habla. Cada unidad genera su propia identidad sonora al despertar por primera vez y conserva esa voz de forma permanente.
¿Cómo se entrenan realmente los comportamientos?
Las políticas se entrenan en microduck_rl, construido sobre mjlab (MuJoCo Warp) con PPO. Pollen reporta entre una y dos horas en una GPU CUDA para obtener una marcha usable con 4.096 entornos en paralelo. Sin GPU local, agregar la opción --hf-jobs corre el mismo comando en Hugging Face Jobs.
El trabajo de simulación a realidad está en el modelo del actuador. Cada servo usa el modelo BAM M6 del Dynamixel XL330, con ley de control por voltaje, fuerza contraelectromotriz y fricción de Coulomb, Stribeck y dependiente de carga, en lugar de un controlador proporcional derivativo ideal. La aleatorización por entorno cubre voltaje de batería, caída de tensión bajo carga, retardo de comando y magnitud de fricción. Las variantes de juego mecánico entrenan contra más o menos 1 grado de holgura de engranaje, 2 grados en total, en serie con cada una de las 14 articulaciones de servo del esquema de aprendizaje por refuerzo. Como el encoder real se ubica del lado de salida de esa holgura, las observaciones la leen.
Las políticas entrenadas se exportan a ONNX con el normalizador de observaciones incorporado dentro del grafo. Pollen advierte explícitamente contra desplegar puntos de control convertidos a mano por exactamente esa razón.
En el robot, un entorno de ejecución escrito en Rust maneja el lazo de control a 50 Hz y el bus de motores. Cada política comparte una observación de actor de 61 dimensiones: 48 de propiocepción más comandos de giro (3), pose de cabeza (4) y pose de cuerpo (6). Ese contrato compartido es lo que permite intercambiar en caliente las políticas de caminata, recuperación y trucos en plena ejecución. Los entornos que ignoran una ranura de comando la rellenan con ceros en lugar de descartarla.
El registro publicado cubre 13 tareas: seguimiento de velocidad, ponerse de pie, sentarse y pararse, recoger del suelo, patear una pelota (70 milímetros, 15 gramos, con el actor ciego a la pelota), voltereta y cinco entornos de patinaje.
¿Qué queda abierto y qué no?
- Bípedo de 399 dólares con software abierto, preventa desde el 27 de agosto de 2026 y entregas apuntadas para antes de Navidad.
- 15 motores, cámara, LiDAR, dos unidades inerciales, NFC, Wi-Fi y Bluetooth, RK3566 y cerca de una hora de autonomía.
- Las políticas se entrenan en mjlab sobre MuJoCo Warp con PPO, entre una y dos horas para una marcha con 4.096 entornos.
- El salto de simulación a realidad descansa en el modelo de actuador BAM más aleatorización de voltaje, retardo, fricción y holgura.
- El software es Apache 2.0, pero los archivos de diseño mecánico y electrónico no son abiertos.
Para el lector latinoamericano hay una diferencia práctica respecto de otras plataformas educativas: al precio de un solo brazo robótico de laboratorio, un club universitario puede montar un banco de pruebas de aprendizaje por refuerzo con hardware real. Y la opción --hf-jobs importa más de lo que parece en la región, porque saca del camino el requisito de tener una GPU CUDA local, que suele ser el cuello de botella real en un laboratorio con presupuesto acotado.
Más antecedentes en la página de producto, el blog de lanzamiento, el kit de prensa con la ficha técnica, el repositorio del entorno de ejecución y el repositorio de entrenamiento.




