Investigadores de Google DeepMind desarrollaron GenCeption, un modelo que usa un generador de video preentrenado como base para tareas clásicas de visión artificial. Alcanza resultados de primer nivel en estimación de profundidad, segmentación y estimación de pose 3D, pero necesitando muy pocos datos de entrenamiento.
Los modelos de lenguaje se volvieron sistemas de procesamiento versátiles casi como subproducto de aprender a predecir la siguiente palabra: esa tarea obliga al modelo a absorber gramática, conocimiento del mundo y relaciones contextuales. La visión artificial, en cambio, todavía carece de un método de entrenamiento equivalente y sigue dominada por modelos especializados, cada uno con su propia arquitectura, como Segment Anything para segmentación o Depth Anything para profundidad.
¿Cómo funciona exactamente GenCeption?

GenCeption se construye sobre Wan2.1, el modelo de generación de video de código abierto de Alibaba. El cambio principal es una arquitectura más simple: en lugar de generar video a partir de ruido en muchos pasos pequeños, como hacen los modelos de difusión, produce una predicción en una sola pasada hacia adelante, lo que lo hace lo bastante rápido para uso práctico.
Un prompt de texto le indica al modelo qué tarea ejecutar, igual que una instrucción a un chatbot. GenCeption representa cada salida (mapa de profundidad, mapa de normales de superficie o máscara de segmentación) como una imagen RGB estándar de tres canales, e incluso convierte el movimiento de cámara en una representación de imagen. Para tareas que no producen imágenes, como la predicción de puntos clave 3D, el equipo agrega módulos entrenables y usa una única función de pérdida para todas las tareas.
¿Cuántos datos necesita para igualar a los especialistas?

La mayor parte del entrenamiento provino de un conjunto sintético de apenas 7.500 videos, generado al combinar 800 modelos humanos digitales con 200 secuencias de captura de movimiento y renderizarlos en Blender con distintos fondos y ángulos de cámara. Solo se usaron videos reales para la segmentación guiada por lenguaje.
Con esa dieta, GenCeption se acerca al estado del arte usando entre 7 y 500 veces menos datos que los modelos establecidos. Según el estudio, iguala o supera a DepthAnything 3 en profundidad, vence a NormalCrafter y Lotus-2 en normales de superficie, y a Genmo y TRAM en reconocimiento de pose 3D. En segmentación compleja guiada por lenguaje, empata con la combinación de SAM 3 de Meta y Gemini 3.5 Flash. Modelos como D4RT y VGGT Omega se entrenaron con millones de videos; GenCeption llega a resultados similares con una fracción de esos datos.
¿Qué límites tiene?
El modelo entrenó casi exclusivamente con videos sintéticos de una sola persona a la vez, pero generaliza a videos reales con varias personas en cuadro e incluso a categorías que nunca vio, como animales y robots humanoides. Algunas salidas conservan más detalle que los renders de Blender de origen, al punto de preservar los bigotes de un gato o los bordes de mechones de pelo individuales.
No todo es perfecto. El entrenamiento conjunto de todas las tareas perjudica la estimación de puntos clave 3D, y la velocidad todavía necesita trabajo: el modelo pequeño tarda unos seis segundos en procesar un video de 81 fotogramas, y el grande, de 14.000 millones de parámetros, unos diez segundos.
Un debate abierto sobre los modelos del mundo
Los autores rechazan la idea de que los generadores de video sean solo herramientas de entretenimiento y sostienen que ya contienen un tipo de modelo del mundo universal que podría servir de base para la visión artificial, el mismo rol que los modelos de lenguaje cumplen en el texto. La afirmación es discutida. Un equipo internacional propuso hace poco una definición uniforme con OpenWorldLib y excluyó de forma explícita a los generadores de video por carecer de retroalimentación del mundo real. El exjefe científico de IA de Meta, Yann LeCun, va más lejos y considera que los modelos generativos de video son un callejón sin salida; su alternativa, V-JEPA 2, predice conceptos abstractos en lugar de píxeles. Un benchmark de la Universidad de Tsinghua refuerza la duda: Sora 2, Seedance 2.0 y Veo 3.1 fallaron repetidamente pruebas de física y lógica básicas aunque su salida se viera convincente.
GenCeption usa la generación de video para un fin más acotado: no le pide a Wan2.1 que prediga cómo se comportará el mundo, sino que extrae rasgos útiles para tareas concretas donde esos rasgos aprendidos superan a los sistemas especializados. En paralelo, DeepMind explora otro camino con Genie 3, que construye entornos 3D interactivos para entrenar agentes de IA.




