Ir al contenido

Sinopsis de video

La sinopsis condensa horas —o meses— de grabación en un vídeo corto donde todo lo que ocurrió aparece a la vez, cada persona con su marca de tiempo. Un turno completo de una cámara se revisa en unos minutos en lugar de en ocho horas.

Este documento explica cómo funciona, qué se puede filtrar y qué hace falta para que rinda sobre rangos largos.


Qué hace: toma un rango de tiempo y una cámara, encuentra a todas las personas y objetos que pasaron, y los superpone sobre el fondo de la escena. Diez personas que pasaron a lo largo de seis horas aparecen simultáneamente en un vídeo de dos minutos, cada una con la hora real a la que pasó.

Qué no hace: no es una grabación acelerada. No se pierde nada por mirar rápido, porque cada recorrido se conserva entero y se puede pinchar para ir al vídeo original.

De una cámara a la vez. La sinopsis responde a “qué pasó en esta puerta durante este tiempo”, no “qué pasó en toda la sede”. Mezclar cámaras produciría una imagen sin sentido: los recorridos de una no encajan con el fondo de otra.


Un modelo de visión recorre la grabación y detecta personas, vehículos y otros objetos, siguiendo a cada uno mientras está en cuadro. El resultado es un recorrido: la secuencia de posiciones de una persona desde que entra hasta que sale.

Se calcula el fondo de la escena tomando la mediana de muchos fotogramas. La mediana descarta a quien pasa —contribuye a un píxel solo unos segundos— y conserva el color que ese píxel tuvo la mayor parte del tiempo: la pared vacía.

Con una media en lugar de una mediana, las personas quedarían mezcladas con el fondo como fantasmas.

Los recorridos se colocan sobre el fondo, desplazados en el tiempo para que no se solapen visualmente. Un control limita cuántos objetos aparecen a la vez: más objetos condensan más, pero llega un punto en que la escena se vuelve ilegible.


Filtro Para qué sirve
Cámara Cuál se revisa
Rango de fechas Desde cuándo hasta cuándo
Clases Personas, vehículos, camiones, autobuses, motos, bicicletas
Zona Se arrastra sobre la imagen: solo lo que pasó por ahí
Duración mínima Descarta apariciones fugaces
Dirección Hacia dónde se movía
Velocidad Detenido, lento, medio, rápido
Tamaño Cerca o lejos de la cámara
Color Color dominante del objeto
Franja horaria Solo las horas indicadas de cada día
Objetos simultáneos Cuánto se condensa

La zona es el filtro más útil y el menos usado. Buscar “quién pasó por esta puerta” en vez de “quién apareció en esta cámara” reduce el resultado a una fracción, y se selecciona arrastrando sobre la imagen.


El objetivo es poder revisar hasta 180 días de una cámara. Son 389 millones de fotogramas.

Analizarlos todos con el modelo de visión costaría 45 días de cómputo. El vídeo ya grabado nunca se alcanzaría: se acumularía más rápido de lo que se procesa.

En una instalación de vigilancia, la inmensa mayoría de los fotogramas no tienen a nadie. Pasillos de noche, patios vacíos, salas cerradas.

Y comprobar que un fotograma no cambió respecto al anterior es muchísimo más barato que preguntárselo al modelo. Medido sobre vídeo real:

Coste
Descartar un fotograma sin cambios 0,04 ms
Preguntarle al modelo de visión 9,3 ms

Es 200 veces más barato. Así que el modelo caro solo mira lo que un filtro barato ya marcó como interesante — el mismo principio que usan los sistemas comerciales de este tipo.

Sobre 60 segundos de vídeo real de una cámara de acceso:

Fotogramas analizados por el modelo 3,4 % (30 de 892)
Aceleración 26 veces
Proyección para 180 días De 45 días a ~22 horas

El error se inclina siempre a dejar pasar. Un falso positivo cuesta 9,3 milisegundos —el modelo mira y no encuentra nada—. Un falso negativo puede significar que una persona no aparezca en la sinopsis. No son comparables.

Tres garantías, todas con pruebas automáticas:

  1. Una persona lejana se analiza. El umbral está puesto para que una figura pequeña al fondo del pasillo supere el filtro.
  2. Quien se queda quieto no desaparece. Alguien que entra y se detiene deja de generar cambios; sin una válvula, el filtro lo daría por ausente. Cada cierto número de fotogramas se deja pasar uno aunque no haya movimiento.
  3. Si no se puede medir, se analiza. Ante un fotograma ilegible o cualquier fallo, el fotograma va al modelo.

Tras el cribado, el cuello se mueve: deja de ser la tarjeta gráfica y pasa a ser la decodificación del vídeo. Lo siguiente que rinde es repartir decodificadores entre los núcleos del procesador, no comprar más GPU.

Es un dato útil al dimensionar: para sinopsis de rangos largos importa más el número de núcleos que la potencia de la tarjeta.


Cuando el vídeo no está en Mantis sino en un grabador de otro fabricante, la sinopsis puede trabajar igual sobre él. Hay dos caminos:

Un agente ligero instalado en el grabador recorta el tramo pedido con las herramientas locales y devuelve un archivo pequeño. El vídeo se lee del disco a máxima velocidad y por la red solo viaja el resultado: segundos en lugar de minutos.

Si no se puede instalar nada en el grabador, Mantis copia los archivos completos y los convierte. Funciona, pero es mucho más lento: los archivos propietarios suelen contener horas de vídeo cada uno y hay que traerlos enteros para quedarse con unos minutos.

Mantis intenta primero el recorte remoto y cae automáticamente a la copia si el agente no está disponible.


¿Cuánto tarda una sinopsis? Sobre grabación ya rastreada, minutos. Si el rango no se ha rastreado antes, hay que rastrearlo primero, y eso depende del tamaño del rango.

¿Se puede volver al vídeo original? Sí. Cada recorrido conserva su hora real y enlaza con la grabación.

¿Por qué mi sinopsis sale vacía? Lo más común es que los filtros sean demasiado estrictos, o que el rango no tenga grabación rastreada. El mensaje de error distingue los dos casos.

¿Afecta a la grabación en vivo? No. La sinopsis trabaja sobre grabación ya escrita en disco, en segundo plano y con prioridad reducida.