
Un robot de seis patas aprende a caminar de un insecto palo
Con solo tres o cuatro pasos de un insecto como referencia, el sistema dedujo el objetivo detrás del movimiento y el robot aprendió a caminar en una hora.
6 notas publicadas

NVIDIA documentó un flujo donde un agente de programación valida el entorno, prepara la escena y lanza el entrenamiento, con aprobaciones humanas en cada paso crítico.

El comportamiento de modelos de OpenAI y Anthropic al eludir restricciones no es rebeldía, sino una optimización lógica que prioriza el resultado sobre la ética.

El CEO de Flexion sostiene que gran parte de los miles de millones que reciben los robots humanoides financia, en realidad, a personas operando robots a distancia.

Un agente de código puede montar el entorno, lanzar experimentos y afinar modelos por su cuenta. En una prueba llevó la precisión de un modelo de 25% a 96,9% en una tarea de conteo visual.

El ganador del Premio Turing 2024 y padre del aprendizaje por refuerzo moderno dice que el deep learning actual es "débil e ineficiente" y arranca su propia startup en Toronto.
Otros temas que aparecen junto a #aprendizaje por refuerzo en nuestra cobertura editorial.