Los desarrolladores que construyen aplicaciones de analítica de video en espacios grandes enfrentan un problema común: seguir el mismo objeto a medida que se mueve entre distintas cámaras. El seguimiento 2D con una sola cámara carece de información de profundidad confiable y suele perder el objeto cuando sale del cuadro, lo que limita usos como la seguridad en bodegas, la analítica en retail o el monitoreo de edificios inteligentes. Los métodos actuales de tracking 3D, además, exigen calibración manual de cámaras y cálculos complejos.

NVIDIA DeepStream 9.1 aborda ese desafío con dos habilidades nuevas: AutoMagicCalib (AMC) y Multi-View 3D Tracking (MV3DT). Juntas fusionan las detecciones de múltiples cámaras autocalibradas en un sistema de coordenadas 3D compartido y mantienen un ID de objeto consistente entre todas las vistas.

¿Qué trae de nuevo DeepStream 9.1?

  • Acceso a 13 habilidades para agentes diseñadas para acelerar el desarrollo de visión con IA
  • La habilidad de tracking 3D multicámara (MV3DT) para seguimiento de objetos de extremo a extremo entre varias cámaras
  • La habilidad AutoMagicCalib (AMC), que automatiza la calibración de cámaras y reduce el esfuerzo manual y los errores
  • Soporte para NVIDIA JetPack 7.2, que habilita rendimiento acelerado de visión con IA en placas de borde Jetson como Orin y Thor
  • Disponibilidad de código abierto a través de un repositorio unificado en GitHub

DeepStream 9.1 ya está disponible en el repositorio de GitHub de NVIDIA DeepStream, con código fuente completo y aplicaciones de referencia.

¿Cómo sigue MV3DT un objeto entre cámaras?

MV3DT proyecta las detecciones de múltiples cámaras calibradas hacia un sistema de coordenadas 3D compartido. Luego asocia las observaciones de un mismo objeto entre las distintas vistas y le asigna un único ID global consistente. Cada cámara proyecta los objetos a 3D de forma independiente y el sistema fusiona esas entradas para garantizar un seguimiento coherente en todo el entorno. Los algoritmos de asociación multivista y las técnicas de fusión 3D están detallados en el paper de investigación Fully Distributed Multi-View 3D Tracking in Real-Time.

Figura 1. Visión general del sistema MV3DT (Hernández et al., 2026)
Figura 1. Visión general del sistema MV3DT (Hernández et al., 2026)

El flujo de datos funciona así:

  • Detección: el pipeline de DeepStream procesa todos los flujos de cámara y el rastreador MV3DT detecta y sigue objetos en cada vista. Soporta tres modelos detectores de fábrica: PeopleNetTransformer (detector de personas basado en transformers, por defecto en escenas peatonales), PeopleNet v2.6.3 (detector de alta eficiencia sobre la arquitectura DetectNet_v2) y RT-DETR 2D (detector multiclase para entornos industriales, capaz de reconocer peatones, transportadores y montacargas).
  • Percepción 3D monocular: cada cámara usa una matriz de proyección de 3x4 (guardada en un archivo de calibración YAML) para retroproyectar las detecciones 2D a coordenadas del mundo en 3D, asumiendo un plano de suelo.
  • Asociación multivista: el rastreador usa MQTT, un protocolo liviano de mensajería de publicación y suscripción, para compartir los tracklets entre cámaras. Cuando dos cámaras observan a la misma persona, el algoritmo cruza sus tracklets por proximidad en el espacio 3D y asigna un único ID global.
  • Salida: los resultados se entregan en tres formatos: una vista en pantalla (OSD) con las cajas delimitadoras superpuestas, una vista cenital (BEV) que muestra las trayectorias en coordenadas del mundo, y mensajería Kafka con metadatos estructurados por cuadro para aplicaciones posteriores.

¿Cómo automatiza AMC la calibración?

MV3DT necesita cámaras calibradas que mapeen con precisión los píxeles de la imagen a coordenadas del mundo mediante esa matriz de 3x4. Los enfoques tradicionales son manuales y lentos: suelen requerir colocar patrones de calibración (como tableros de ajedrez) frente a las cámaras, lo que obliga a interrumpir las operaciones.

Figura 2. Página de resultados de AutoMagicCalib con las trayectorias sobre una vista cenital tras la calibración
Figura 2. Página de resultados de AutoMagicCalib con las trayectorias sobre una vista cenital tras la calibración

AMC simplifica y automatiza ese proceso analizando con DeepStream los objetos que se mueven en archivos de video o flujos ya existentes. Estima de forma automática los parámetros intrínsecos (distancia focal, punto principal, distorsión de lente) y extrínsecos (rotación, traslación, posición en el mundo) de cada cámara para producir los archivos de calibración. De manera opcional puede apoyarse en VGGT, un modelo que aporta mayor precisión cuando el movimiento de los objetos es limitado. El usuario solo debe entregar una imagen de plano y definir unos pocos puntos de alineación. AMC se ofrece como microservicio con API REST e interfaz web.

Un giro hacia el desarrollo con agentes

La novedad conceptual de DeepStream 9.1 es que sus habilidades están pensadas para que las usen agentes de código como Claude Code, Codex u otros. En lugar de ejecutar scripts a mano y editar archivos de configuración, el desarrollador describe en lenguaje natural lo que quiere y el agente se encarga del montaje, la configuración y la ejecución del pipeline de tracking multicámara. Todo el código y las aplicaciones de referencia están disponibles en el repositorio de DeepStream en GitHub.