StreamVLM™: Escreva uma Frase e Obtenha um Detector

A análise de vídeo convencional exige meses de coleta de dados, rotulagem e treinamento para cada novo caso de uso. StreamVLM™ utiliza um modelo de visão e linguagem que já compreende imagens e linguagem. Assim, um detector descrito em uma frase começa a funcionar imediatamente.

Agende uma Demonstração

A Variedade de Necessidades Pouco Comuns

As Condições que Nenhum Fornecedor Oferece de Fábrica

Cada cidade precisa ver situações para as quais nenhum fornecedor de análise vende um módulo: uma pessoa deitada no chão, uma cerca danificada ou descarte irregular de resíduos atrás de um depósito. Isoladamente, nenhuma justifica um programa de treinamento. Juntas, representam a maior parte do que realmente preocupa um município. A biblioteca visual abaixo reúne 24 dessas condições, com a vista de câmera e a página que explica cada uma.

StreamVLM™ atende a essa necessidade. Um operador escreve a condição em inglês simples; o mecanismo avalia os quadros ao vivo com base na instrução. As correspondências geram alertas em tempo real como qualquer outro evento. Cada canal de câmera aceita vários detectores simultâneos baseados em instruções, cada um com limiar de confiança, intervalo entre alertas e tipo de evento próprios.

StreamVLM™ está incluído no preço padrão da IREX: não há cobrança separada de licença, módulo ou assinatura. O único custo adicional é um nó GPU local para inferência VLM quando a implantação exigir.

Exemplo

Uma Pessoa Caída em uma Estação de Metrô

Um Detector que Ninguém Treinou

"Emita um alerta quando uma pessoa estiver deitada no chão." Não existe um conjunto de dados de pessoas caindo em plataformas para treinamento. Coletá-lo não seria prático nem digno. Um modelo de visão e linguagem não precisa dele: já compreende a cena, por isso a instrução é a especificação.

Um homem está deitado de lado em um saco de dormir junto à parede de um corredor de conexão do metrô, com uma mala e uma sacola ao lado.
Uma instrução, uma classe de evento. A plataforma informa uma pessoa no chão; o operador determina o que está acontecendo.

Biblioteca de Casos de Uso

24 Casos de Uso do StreamVLM e Análises Relacionadas

Explore 24 condições definidas por instruções, cada uma com uma imagem ilustrativa de câmera e sua própria página. Um fluxo de trabalho treinado relacionado a veículos de duas rodas completa a biblioteca visual.

O que o Diferencia

Um Mecanismo em Vez de um Módulo por Problema

Sem Processo de Treinamento

Sem coleta de dados, rotulagem nem modelo específico por caso de uso. Um novo detector é uma frase e funciona desde o momento em que é salvo.

Um Mecanismo, Cenários Ilimitados

Projetado para substituir e unificar vários módulos anteriores, entre eles a detecção de fogo, o monitoramento da qualidade de vídeo e a detecção de violação.

Ajustável por Detector

O limiar de confiança, o intervalo entre alertas e o tipo de evento são configurados individualmente, para que uma condição com muitos alertas não sobrecarregue o operador.

Registrado como Todo o Restante

Cada instrução, quadro analisado, alerta e ação de agente é registrado com horário, identidade do operador e identificador do caso, sob acesso baseado em papéis.

Alimenta Buscas e Painéis

Os eventos do StreamVLM chegam aos mesmos três modos dos módulos clássicos: alertas em tempo real, investigações no arquivo e exportação de Big Data.

As Salvaguardas contra Vieses se Aplicam

Um detector definido por instruções opera dentro do mesmo modelo ético dos módulos treinados, incluindo a regra de restrições estritas.

Perguntas Frequentes

O StreamVLM está disponível em nossa instância?

StreamVLM funciona em um nó GPU na instância do cliente. A equipe de engenharia da IREX confirma se uma implantação específica está incluída; isso não é prometido antecipadamente.

Há custo adicional?

Não. StreamVLM está incluído no preço padrão da IREX, sem cobrança separada de licença, módulo ou assinatura. Se a implantação precisar de um nó GPU local para inferência VLM, seu dimensionamento e preço serão definidos com a equipe de engenharia da IREX.

Quantos detectores uma câmera pode executar?

Vários. Um canal de câmera executa vários detectores definidos por instruções ao mesmo tempo, cada um com limiar de confiança, intervalo entre alertas e tipo de evento próprios. A IREX ainda não publica um limite por câmera: a densidade depende do hardware do cliente e é medida com suas próprias câmeras durante o piloto.

Pode substituir nossos módulos de análise atuais?

Foi projetado para unificar vários deles, incluindo detecção de fogo, monitoramento da qualidade de vídeo e detecção de violação. Os detectores treinados que operam em altas taxas de quadros continuam sendo a ferramenta adequada para acompanhar pessoas e veículos em movimento rápido.

Qual modelo o StreamVLM utiliza e a que ele pode ter acesso?

Um modelo de visão e linguagem de pesos abertos publicado por terceiros e usado como é publicado. A IREX não faz ajuste fino nem modifica seus pesos; fixa sua versão e soma de verificação. O modelo é servido apenas em endpoints designados dentro de sua instância, no nó GPU dessa instância. Nenhum quadro, instrução ou avaliação sai dela e nenhuma instância em qualquer região usa inferência em nuvens de terceiros. O modelo não chama ferramentas, não mantém memória entre quadros e não tem acesso ao arquivo, à base de eventos, às listas de observação, a outras câmeras nem à rede. Também não tem função biométrica: avalia cenas e condições e não pode identificar uma pessoa. A IREX não publica qual modelo utiliza; identidade, versão e soma de verificação são comunicadas ao cliente sob acordo de confidencialidade. Nomear o modelo cria uma superfície de ataque e comunica uma informação que fica desatualizada. A parte B da Política de governança de modelos de IA pública estabelece todas essas regras.

Diga o que Você Precisa Ver

Traga as condições que realmente preocupam sua cidade. Se uma instrução puder descrevê-las, normalmente podemos mostrar um detector para elas durante o piloto.

Agende uma Demonstração