Las cámaras llevan décadas mirando y grabando. Ahora los sistemas de vigilancia quieren entender lo que ocurre y reaccionar a tiempo. En ese cambio, el sonido gana peso. Un altavoz disuade, un micrófono detecta y un canal bidireccional pone a una persona al otro lado. Nick Grillone, ingeniero de aplicaciones de same sky, explica en un artículo de fondo publicado por Seguridad Profesional Hoy cómo encaja el audio en esa transición. Repasamos sus ideas y añadimos cifras que ayudan a dimensionar un proyecto. También hablamos del catálogo de la empresa, de los problemas acústicos de los exteriores y de las obligaciones de privacidad que conviene cumplir desde el primer día.
De las cámaras a los sistemas multisensor
Una cámara depende de la luz, del campo de visión y de la línea de visión directa. Si algo ocurre tras una esquina o en plena noche, el vídeo se queda corto. El audio cubre ese hueco. Los sistemas actuales combinan imagen, sonido y otros sensores para interpretar mejor una escena. Dos factores empujan el cambio. El primero es el análisis en el propio dispositivo, que evita enviar todos los datos a un servidor. El segundo es la demanda de respuesta inmediata, frente a la revisión posterior de las grabaciones. El resultado es una vigilancia que deja de archivar y empieza a intervenir.
Sirenas y voz para disuadir
La forma más directa de usar el audio es la disuasión. Un altavoz puede emitir una sirena, un mensaje pregrabado o la voz de un operador remoto. La respuesta puede ser automática o manual. En un perímetro, un aviso audible antes de la escalada frena muchas intrusiones. En un comercio, indica al posible ladrón que alguien observa. En una zona peligrosa, refuerza las normas de acceso.
Hay un dato físico que conviene recordar. En campo libre, el nivel sonoro baja unos 6 dB cada vez que se duplica la distancia. Una sirena de 100 dB medidos a 1 m llega a unos 80 dB a 10 m. Ese margen condiciona la elección del altavoz y su ubicación.
Hablar con quien está al otro lado
El audio bidireccional añade una capa humana. El operador ve la escena, oye el entorno y se dirige a la persona. Lo habitual es integrarlo en el software de gestión de vídeo para que imagen y sonido lleguen sincronizados.
Para que la conversación resulte natural, la latencia importa mucho. La ITU-T Recommendation G.114 recomienda mantener el retardo de extremo a extremo por debajo de 150 ms en un solo sentido. Por encima de 400 ms deja de ser aceptable para la planificación de redes. Otro enemigo es el acoplamiento entre altavoz y micrófono, el conocido efecto Larsen. Los cancelladores de eco suelen buscar atenuaciones del orden de 30 dB para controlarlo.
Micrófonos que detectan antes de ver
El micrófono también trabaja como sensor. Puede detectar rotura de cristales, disparos o sonidos anómalos, como gritos e impactos. Muchos de esos eventos suceden fuera del encuadre. El sonido llega antes y con más cobertura angular que la imagen.
Los fabricantes de cámaras ya lo aplican. AXIS Audio Analytics se ejecuta en el propio equipo e identifica cristales rotos, voz, gritos y chillidos. Además mide el nivel de presión sonora y los picos de volumen. Según Axis, no graba ni transmite audio salvo que lo active un usuario autorizado.
El ancho de banda tampoco es un obstáculo serio. Un canal mono a 16 kHz y 16 bits ocupa 256 kbit/s sin comprimir. Con el códec G.711 baja a 64 kbit/s. Es poco frente a los 1 a 4 Mbit/s que suele consumir un flujo de vídeo 1080p en H.265. Lo difícil es decidir dónde se procesa el sonido y cómo se sincroniza con la imagen.
Retos de diseño en exteriores
El entorno complica el audio. La voz ocupa sobre todo la franja de 300 Hz a 3,4 kHz. El viento genera ruido de baja frecuencia, sobre todo por debajo de 1 kHz, y esa zona se solapa con la voz. Las pantallas antiviento y el filtrado digital ayudan a separarlas. El eco y la reverberación degradan la inteligibilidad en espacios con superficies duras. La colocación del micrófono y del altavoz limita, además, la cobertura real.
Hay que vigilar el consumo y la temperatura, porque el procesado local carga el dispositivo. La seguridad física también cuenta. Un equipo expuesto sufre golpes y manipulaciones. Una carcasa con grado IP66 resiste polvo y chorros de agua. Un índice IK10 soporta impactos de 20 J. La rejilla acústica debe proteger sin tapar el sonido.
El catálogo de same sky
El artículo original procede de same sky, un fabricante de componentes de audio. Su autor trabaja en ingeniería de aplicaciones y se especializa en micrófonos, altavoces y sensores. La compañía ofrece altavoces, micrófonos y zumbadores, incluidas sirenas. Presenta esa gama como respuesta a las exigencias descritas: emitir avisos, captar sonido y encajar en equipos de vigilancia más receptivos.
Es un enfoque de componente, no de sistema cerrado. Esto interesa a quien diseña su propia cámara o integra equipos de terceros. Antes de elegir, conviene comparar en las hojas de características la sensibilidad, el nivel de presión sonora máximo y el grado de protección.
Privacidad y tratamiento de datos
El audio grabado o analizado puede contener voz, y la voz es información sensible. El diseñador debe cifrar la transmisión, controlar el almacenamiento y el acceso, y cumplir la normativa de cada región. En la Unión Europea, las EDPB Guidelines 3/2019 on processing of personal data through video devices orientan sobre cómo aplicar el RGPD a la videovigilancia. Insisten en valorar la necesidad y la relevancia de cada tratamiento. Conviene aplicar ese mismo criterio al sonido. Analizar el audio en el dispositivo sin grabarlo reduce la exposición desde el diseño.
Reflexiones adicionales
El audio no sustituye al vídeo. Lo completa. Una alerta sonora aislada puede confundir un portazo con un disparo. Por eso tiene sentido que el evento acústico dispare la verificación visual y que un operador decida. Para el instalador, el mensaje es claro. El proyecto acústico se estudia al principio, igual que el óptico, y no al final.
Queda una cuestión abierta. Cuanto más entienden estos sistemas, más datos sensibles manejan. La mejor garantía será una arquitectura que procese lo mínimo y conserve lo imprescindible. Un sistema que escucha bien y calla lo que no necesita guardar será más eficaz y más fácil de defender ante un usuario o una autoridad.
5
