StreamVLM™: escriba una frase y obtenga un detector

La analítica de video convencional requiere meses de recopilación de datos, etiquetado y entrenamiento para cada nuevo caso de uso. StreamVLM™ utiliza un modelo de visión y lenguaje que ya comprende imágenes y lenguaje. Así, un detector descrito en una frase empieza a funcionar de inmediato.

Las necesidades específicas

Las condiciones que ningún proveedor incluye de serie

Cada ciudad necesita ver situaciones para las que ningún proveedor de analítica vende un módulo: una persona tendida en el suelo, una cerca dañada o vertidos ilegales detrás de un depósito. Por separado, ninguna justifica un programa de entrenamiento. Juntas representan gran parte de lo que preocupa realmente a un municipio. Más adelante encontrará otras ocho, cada una redactada como la escribiría un operador.

StreamVLM™ cubre esa necesidad. Un operador escribe la condición en inglés sencillo; el motor evalúa los fotogramas en vivo según la instrucción. Las coincidencias generan alertas en tiempo real como cualquier otro evento. Cada canal de cámara admite varios detectores simultáneos basados en instrucciones, cada uno con su propio umbral de confianza, intervalo entre alertas y tipo de evento.

StreamVLM™ está disponible en versión beta en determinadas instancias. Está incluido en el precio estándar de IREX: no tiene cargos separados de licencia, módulo o suscripción. El único costo adicional es un nodo GPU local para inferencia VLM cuando el despliegue lo requiere.

Ejemplo

Una persona caída en una estación de metro

Un detector que nadie entrenó

Ejemplo traducido al español: “Alerte cuando una persona esté tendida en el suelo”. No existe un conjunto de datos de personas que se desploman en andenes con el cual entrenar; recopilarlo no sería práctico ni digno. Un modelo de visión y lenguaje no lo necesita: ya comprende la escena, por lo que la instrucción constituye la especificación.

Una mujer mayor con un abrigo acolchado yace de costado junto a un banco en un andén del metro de Estocolmo. Su andador está volcado y las compras, esparcidas a su lado; no hay nadie cerca.
Una instrucción, una clase de evento. La plataforma reporta a una persona en el suelo; el operador determina qué está ocurriendo.

En el mapa

La misma frase, dondequiera que la ejecute

Explore los ejemplos por ubicación y abra una coincidencia para ver la imagen completa. Las instrucciones de StreamVLM™ se presentan traducidas al español. El mapa también incluye módulos entrenados y búsquedas en grabaciones.

San Diego, Estados Unidos
BÚSQUEDA
Case ID #IRX-2026-0103 · proporcionado Buscando…

Ejemplos ilustrativos. Las instrucciones de StreamVLM™ se presentan traducidas al español.

COINCIDENCIAS
Búsqueda en más de 3.000 cámaras en 0,4 segundos

Qué lo diferencia

Un motor en lugar de un módulo por problema

Sin proceso de entrenamiento

Sin recopilación de datos, etiquetado ni modelo específico por caso de uso. Un nuevo detector es una frase y funciona desde el momento en que se guarda.

Un motor, escenarios ilimitados

Diseñado para sustituir y unificar varios módulos anteriores, entre ellos la detección de fuego, la supervisión de calidad de video y la detección de manipulación.

Ajustable por detector

El umbral de confianza, el intervalo entre alertas y el tipo de evento se configuran individualmente, para que una condición ruidosa no sature al operador.

Registrado como todo lo demás

Cada instrucción, fotograma analizado, alerta y acción de agente se registra con marca de tiempo, identidad del operador y Case ID, bajo acceso basado en roles.

Alimenta búsquedas y tableros

Los eventos de StreamVLM llegan a los mismos tres modos que los módulos clásicos: alertas en tiempo real, investigaciones sobre el archivo y exportación de Big Data.

Se aplican las salvaguardas contra sesgos

Un detector definido mediante instrucciones opera dentro del mismo marco ético que los módulos entrenados, incluida la regla de restricciones estrechas.

Preguntas frecuentes

¿StreamVLM está disponible en nuestra instancia?

Está disponible en versión beta en determinadas instancias. El equipo de ingeniería de IREX confirma si un despliegue concreto está incluido; no se promete de antemano.

¿Tiene un costo adicional?

No. StreamVLM está incluido en el precio estándar de IREX, sin cargos separados de licencia, módulo o suscripción. Si el despliegue necesita un nodo GPU local para inferencia VLM, su dimensionamiento y precio se definen con el equipo de ingeniería de IREX.

¿Cuántos detectores puede ejecutar una cámara?

Varios. Un canal de cámara ejecuta varios detectores definidos mediante instrucciones al mismo tiempo, cada uno con su propio umbral de confianza, intervalo entre alertas y tipo de evento. IREX todavía no publica un límite por cámara: la densidad depende del hardware del cliente y se mide con sus propias cámaras durante el piloto.

¿Puede sustituir nuestros módulos de analítica actuales?

Está diseñado para unificar varios de ellos, incluidos la detección de fuego, la supervisión de calidad de video y la detección de manipulación. Los detectores entrenados que operan a altas frecuencias de fotogramas siguen siendo la herramienta adecuada para seguir a personas y vehículos en movimiento rápido.

¿Qué modelo utiliza StreamVLM y a qué puede acceder?

Un modelo de visión y lenguaje de pesos abiertos publicado por un tercero y utilizado tal como se publica. IREX no lo ajusta ni modifica sus pesos; lo fija por versión y suma de verificación. Solo lo sirve en puntos de acceso designados dentro de su instancia, sobre el nodo GPU de esa instancia. Ningún fotograma, instrucción ni evaluación sale de ella, y ninguna instancia de ninguna región utiliza inferencia en nubes de terceros. El modelo no llama a herramientas, no conserva memoria entre fotogramas y no tiene acceso al archivo, la base de eventos, listas de búsqueda, otras cámaras ni la red. Tampoco tiene una función biométrica: evalúa escenas y condiciones y no puede identificar a una persona. IREX no publica qué modelo utiliza; su identidad, versión y suma de verificación se comunican al cliente bajo un acuerdo de confidencialidad. Nombrar el modelo crea una superficie de ataque y comunica un dato que pierde vigencia. La parte B de la Política de gobernanza de modelos de IA pública establece todas estas reglas.

Díganos qué necesita ver

Traiga las condiciones que realmente preocupan a su ciudad. Si una instrucción puede describirlas, normalmente podemos mostrarle un detector para ellas durante el piloto.

Solicitar una demostración