Analítica de audio en las cámaras que ya tiene

Una cámara solo ve lo que entra en el encuadre. Su micrófono escucha toda la habitación. AudioTrack convierte la transmisión de audio que ya lleva una cámara en cuatro clases de eventos. Se alertan y buscan como cualquier detección visual, sin sensor acústico, conjunto de micrófonos ni cableado adicional.

El módulo

AudioTrack, un detector en el canal de la cámara

AudioTrack clasifica el sonido de la transmisión de audio de una cámara en cuatro tipos de eventos: disparo, rotura de vidrio, grito y sonido fuerte. Cada uno se activa por separado, tiene su propia prioridad y llega a la misma lista de eventos, monitor de alarmas y archivo que las detecciones visuales de esa cámara. Es un detector, no un módulo independiente, por lo que se agrega a las capacidades que ya ejecuta el canal.

El hardware es la cámara. Cualquier cámara con micrófono puede ejecutarlo: el audio llega por la transmisión en AAC, G.711 mu-law o PCM. La transmisión de audio es opcional por canal y no hay un sensor acústico que comprar, montar, alimentar o mantener. Una sala de control que ya tiene cámaras con micrófonos ya tiene una red de sensores acústicos. Esta página explica cómo activarla donde vale la pena escuchar.

El sonido cubre lo que la vista no capta. Un disparo detrás de una columna, un vidrio que se rompe en un almacén hacia el que no apunta la cámara, un grito en una escalera al borde del campo de visión: ninguno aparece en el encuadre, pero todos se escuchan. Por eso la clase de disparos también figura en la página de detección de armas, junto a GunTrack, como la segunda de tres formas independientes de activar la misma alarma.

Cuatro clases

Qué escucha

Disparo

La clase de evento que avisa a los equipos de respuesta. Funciona junto a la detección visual de armas en el mismo canal, para que un arma disparada fuera del encuadre siga siendo un sonido escuchado.

Ver detección de armas y disparos

Rotura de vidrio

Una fachada comercial, una ventana de almacén, una vitrina o la ventana de un vehículo en una explanada. El sonido llega antes de que alguien entre en el encuadre; ese es el propósito.

Grito

Una persona en peligro fuera de la vista de la cámara, en un pasillo, una escalera o el extremo de un andén. El fotograma, la cámara y la hora llegan a un operador para que los verifique.

Sonido fuerte

La categoría general. Todo sonido fuerte que el módulo no pueda identificar como una de las otras tres clases se reporta en lugar de descartarse: una puerta, una tarima que cae o algo que requiere una llamada. Una persona decide.

Configuración

Tres ajustes por cámara

Todo lo que configura el operador está en la pestaña Detectores de la cámara; no se entrena ni se ajusta nada para todo el sitio.

  1. 01

    Active las clases que necesita

    Cada uno de los cuatro tipos de eventos se selecciona por separado y recibe su propia prioridad. Un almacén comercial puede activar solo rotura de vidrio y sonido fuerte; un pasillo de campus puede ejecutar los cuatro.

  2. 02

    Ajuste la sensibilidad

    Un solo control deslizante de sensibilidad determina qué tan fuerte debe ser un evento respecto del ruido de fondo de esa cámara. Es el ajuste al que se dedica tiempo durante el piloto: el valor correcto en un vestíbulo tranquilo no sirve en el vestíbulo de una estación.

  3. 03

    Dirija el evento

    Los eventos resultantes se asignan por cámara y tipo a los monitores de alarmas de los roles responsables. Se envían a centros de comando en tiempo real, flujos de despacho y la mensajería segura Sover, con el fotograma y la ubicación adjuntos. Después pueden buscarse en Eventos adicionales, como cualquier otra detección.

Aplicación

Dónde resulta adecuado y dónde no

Funciona en
Cualquier cámara conectada con micrófono y audio habilitado en la transmisión. Se recomienda AAC; también se admiten G.711 mu-law y PCM. No requiere sensores separados.
Cómputo
La guía clasifica la complejidad computacional del módulo como baja, por lo que añade poca carga a un servidor que ya ejecuta analítica visual en el mismo canal.
Se combina con
Varios módulos y detectores funcionan simultáneamente en una cámara. GunTrack más AudioTrack en un canal es la configuración habitual para armas. AudioTrack junto a detección de intrusiones o una instrucción de StreamVLM™ es igualmente válido.
No se recomienda
Ubicaciones exteriores ruidosas, como estaciones subterráneas y terminales ferroviarias. El umbral de sensibilidad debe distinguir los eventos del ruido ambiental constante. Preferimos decirlo aquí que descubrirlo juntos durante un piloto.

Qué no afirmamos

Lea esto antes del piloto

  • IREX no publica cifras de alcance, precisión ni latencia para la detección acústica. El compromiso es el mismo de todos los módulos: medirla con sus propias cámaras durante el piloto, según criterios acordados por escrito, e incorporar las cifras medidas al contrato.
  • IREX no afirma localizar un sonido. No existe triangulación entre micrófonos; el evento indica la cámara que lo escuchó. La cobertura depende del plan de cámaras, no de una cuadrícula de sensores.
  • No es un sistema de voz. Las cuatro clases constituyen todo su vocabulario; lo demás es Sonido fuerte o silencio.
  • Las detecciones son señales que una persona debe verificar. Nada responde de forma autónoma, y se establece expresamente que los productos IREX no son sistemas de protección de la vida.

Preguntas frecuentes

¿Necesitamos sensores de disparos en postes?

No. AudioTrack funciona con cualquier cámara que ya tenga micrófono. No requiere comprar, montar, alimentar ni mantener un conjunto acústico, ni operar una red de sensores separada de las cámaras. El audio llega por la transmisión de la cámara en AAC, G.711 mu-law o PCM y es opcional por canal. Actívelo donde vale la pena escuchar y mantenga el resto de la red como está.

¿A qué distancia puede escuchar y con qué frecuencia acierta?

IREX no publica cifras de alcance, precisión ni latencia para la detección acústica, y no vamos a inventarlas para un sitio web. El compromiso es el mismo de los detectores visuales: medimos con sus propias cámaras durante el piloto, según criterios acordados previamente por escrito, y las cifras medidas se incorporan al contrato. La detección usa el micrófono de la cámara, por lo que la cobertura sigue su plan de cámaras, no una cuadrícula de sensores.

¿Funciona en una calle concurrida o una estación?

No se recomienda en ubicaciones exteriores ruidosas, como estaciones subterráneas y terminales ferroviarias. Lo indicamos en la página del producto, no en un informe de piloto. La sensibilidad es relativa al ruido de fondo de esa cámara: un canal con ruido ambiental constante deja poco margen entre el fondo y un evento. Su aplicación adecuada son las cámaras interiores y las exteriores más silenciosas.

¿Graba o comprende conversaciones?

No. El módulo clasifica el sonido en cuatro tipos de eventos y nada más. No transcribe voz ni convierte el audio en un registro de texto consultable. Todo sonido fuerte que no pueda clasificar como disparo, rotura de vidrio o grito se reporta simplemente como Sonido fuerte.

¿Puede una cámara ejecutar analítica de audio y video al mismo tiempo?

Sí, es la configuración habitual. Varios módulos y detectores de analítica de video funcionan simultáneamente en la misma cámara. AudioTrack es un detector, por lo que acompaña a GunTrack, una regla perimetral o una instrucción de StreamVLM™ en un canal. Ambos se complementan: un incidente fuera del encuadre sigue siendo un sonido escuchado, y uno silencioso sigue siendo un objeto visto.

¿Funciona por sí solo o alguien debe observarlo?

Funciona por sí solo y alerta a una persona. Las detecciones son señales que un humano debe verificar: ninguna respuesta se ejecuta de forma autónoma. La verificación y la decisión quedan registradas bajo el mismo Case ID que la detección.

Active los micrófonos que ya tiene

Elija las cámaras que apuntan en otra dirección respecto del problema. En ellas, un micrófono marca la diferencia.