Archive of

Técnicas aplicadas a la analítica de la Videovigilancia y el tráfico

En la imagen se observan técnicas y herramientas de Visión por Computador (Computer Vision) y Aprendizaje Profundo (Deep Learning) aplicadas a la analítica de videovigilancia y tráfico.

Las tecnologías y conceptos principales que intervienen en ese fotograma son:

1. Detección de Objetos en Tiempo Real (Object Detection)

  • Redes Neuronales Convolucionales (CNN): Se utilizan modelos de detección supervisada de alta velocidad, siendo la familia YOLO (You Only Look Once) o arquitecturas similares (como SSD o Faster R-CNN) el estándar para este tipo de superposiciones (overlays).

  • Cajas Delimitadoras (Bounding Boxes): El modelo predice las coordenadas $(x, y, w, h)$ del rectángulo que encierra a cada elemento detectado en la escena.

2. Clasificación de Clases y Datos Etiquetados

  • Dataset COCO / Vocabulario Estándar: Las etiquetas visibles (person, car, traffic light) coinciden con las clases por defecto de conjuntos de datos masivos como COCO (Common Objects in Context).

  • Multiclase simultánea: El algoritmo clasifica y localiza múltiples categorías heterogéneas (peatones, vehículos e infraestructura vial) en una sola pasada sobre el fotograma.

3. Seguimiento de Objetos en Movimiento (Object Tracking)

Para que la detección determine la trayectoria o el movimiento de peatones y coches en una secuencia de video continua, la detección se combina con algoritmos de seguimiento como:

  • DeepSORT / ByteTRACK / Kalman Filters: Asignan un identificador único (ID) a cada objeto entre fotogramas consecutivos para registrar su velocidad, dirección y verificar si está en movimiento o estático.

4. Analítica de Video Urbano / Videovigilancia (VMS / Edge AI)

  • Plataformas de gestión de video (VMS): Estas capas de software procesan el flujo RTSP de la cámara (en la esquina superior izquierda se aprecia la marca de tiempo y número de canal) para ejecutar funciones como:

    • Conteo de peatones y densidad en pasos de cebra.
    • Monitoreo de flujo vehicular e infracciones.
    • Zonas de permanencia o detección de intrusiones.

AMPLIANDO DeepSORT / ByteTRACK / Kalman Filters

Estos tres elementos representan la columna vertebral del seguimiento de objetos (Object Tracking) en visión por computador moderna, un pipeline conocido como MOT (Multiple Object Tracking).

Mientras que un detector (como YOLO) encuentra objetos en un fotograma individual, estos algoritmos le dan memoria temporal al sistema para entender que la persona detectada en el fotograma 1 es exactamente la misma persona en el fotograma 2, 3 y 50.

1. Filtros de Kalman (Kalman Filters)

Es la herramienta matemática fundamental para predecir el movimiento de un objeto a lo largo del tiempo, incluso con ruido o oclusiones temporales.

  • ¿Cómo funciona?: Trabaja en un ciclo continuo de dos pasos:

    • Predicción: Basándose en la posición y velocidad pasadas del objeto (vector de estado), predice dónde debería estar el objeto en el siguiente fotograma.
    • Actualización: Cuando la cámara captura el nuevo fotograma y el detector encuentra el objeto, el Filtro de Kalman combina la predicción teórica con la medición real (ponderando la incertidumbre de ambas) para corregir la trayectoria.
  • Por qué es clave: Si un peatón camina detrás de una farola o un coche pasa por un punto ciego durante 1 o 2 segundos, el Filtro de Kalman mantiene vivo el "fantasma" del objeto en la trayectoria prevista hasta que vuelve a aparecer.

2. DeepSORT (Simple Online and Realtime Tracking with a Deep Association Metric)

DeepSORT es una de las arquitecturas de seguimiento más influyentes. Evolucionó del algoritmo SORT tradicional agregando redes neuronales para evitar perder el rastro cuando los objetos se cruzan.

  • El problema que resuelve: Si dos peatones se cruzan en la calle, los métodos tradicionales basados solo en posición espacial solían confundir sus identidades (intercambiando sus IDs).

  • El toque "Deep" (Apariencia): Utiliza una red neuronal pequeña que extrae un vector de características de apariencia (feature vector o embedding) de cada caja delimitadora. Es decir, memoriza cómo se "ve" el objeto (colores, textura, ropa).

  • Métrica de Asociación: Para asignar un ID en cada fotograma, combina dos distancias:

    • Distancia de Mahalanobis: Evalúa qué tan cerca está la detección de la posición predicha por el Filtro de Kalman.

    • Distancia Coseno: Evalúa qué tan parecida es la imagen del objeto con su apariencia previa.

Caso de uso: Excelente para escenarios complejos donde las personas o vehículos se tapan unos a otros con frecuencia (oclusiones).

3. ByteTRACK (Multi-Object Tracking by Associating Every Detection Box)

Es una arquitectura más reciente y eficiente que solucionó una debilidad histórica de algoritmos como DeepSORT: las detecciones con baja puntuación de confianza.

  • El problema de la baja confianza: Tradicionalmente, si el detector de objetos estaba 40% seguro de que un parche en la imagen era una persona (por estar parcialmente oculta, borrosa por movimiento o en la sombra), el sistema descartaba la caja para evitar falsos positivos. Esto provocaba que el rastro del objeto se rompiera continuamente.

  • La innovación de BYTE: En lugar de tirar las detecciones "dudosas", ByteTRACK aplica un proceso de asociación en dos etapas:

    • Primera asociación: Relaciona las detecciones de alta confianza con los rastros existentes.

    • Segunda asociación: Coge las detecciones de baja confianza restantes y las compara con los rastros no asignados (usando solo la superposición espacial IoU y la predicción del Filtro de Kalman).

  • Resultado: Logra un seguimiento extremadamente fluido en escenas con alta densidad de personas, oclusiones severas o imágenes de baja resolución, reduciendo drásticamente los saltos o pérdidas de identidad sin depender de modelos de apariencia pesados (lo que lo hace muy rápido e ideal para procesamiento en directo).