StreamVLM™: एक वाक्य लिखें, एक डिटेक्टर पाएँ

पारंपरिक वीडियो एनालिटिक्स को हर नए यूज़-केस के लिए महीनों का डेटा-संग्रह, लेबलिंग और ट्रेनिंग चाहिए। StreamVLM™ एक ऐसे Vision-Language Model का उपयोग करता है जो पहले से ही छवियों और भाषा को समझता है, इसलिए जिस डिटेक्टर का वर्णन आप एक वाक्य में करते हैं वह तुरंत काम करना शुरू कर देता है।

डेमो बुक करें

लंबी पूँछ

वे स्थितियाँ जो कोई वेंडर बॉक्स से बाहर नहीं देता

हर शहर के पास ऐसी चीज़ों की एक सूची होती है जिन्हें उसे देखना ज़रूरी है, लेकिन कोई भी एनालिटिक्स वेंडर उनके लिए कोई module नहीं बेचता: ज़मीन पर लेटा कोई व्यक्ति, टूटी हुई बाड़, किसी डिपो के पीछे अवैध कूड़ा-फेंकना। अकेले-अकेले इनमें से कोई भी एक ट्रेनिंग-कार्यक्रम को उचित नहीं ठहराता। साथ मिलकर ये लगभग वही होती हैं जिनकी किसी नगरपालिका को वास्तव में चिंता रहती है, और नीचे दी गई छवि-आधारित लाइब्रेरी ऐसी 24 स्थितियों को कैमरा-दृश्य और हर एक की व्याख्या करने वाले पेज के साथ एक साथ लाती है।

StreamVLM™ यह अंतर पाटता है। ऑपरेटर स्थिति को सरल अंग्रेज़ी में लिखता है, इंजन लाइव कैमरा-फ़्रेम को उस prompt के विरुद्ध जाँचता है, और मैच किसी भी अन्य इवेंट की तरह रियल-टाइम अलर्ट उठाते हैं। हर कैमरा-चैनल एक साथ कई prompt-आधारित डिटेक्टर को सहारा देता है, हर एक का अपना कॉन्फ़िडेंस थ्रेशोल्ड, अलर्ट कूलडाउन, और इवेंट-प्रकार।

StreamVLM™ मानक IREX मूल्य में शामिल है: इसके लिए कोई अलग लाइसेंस, module या सब्सक्रिप्शन शुल्क नहीं है। एकमात्र अतिरिक्त लागत है VLM इन्फरेंस के लिए एक स्थानीय GPU नोड, जहाँ किसी डिप्लॉयमेंट को इसकी ज़रूरत हो।

उदाहरण

मेट्रो स्टेशन में गिरा हुआ व्यक्ति

एक ऐसा डिटेक्टर जिसे किसी ने प्रशिक्षित नहीं किया

"जब कोई व्यक्ति ज़मीन पर लेटा हो तो अलर्ट करें।" प्लेटफ़ॉर्म पर गिरते लोगों का कोई डेटासेट प्रशिक्षण के लिए मौजूद नहीं है, और एक बनाना न तो व्यावहारिक होगा और न ही उचित। किसी Vision-Language Model को इसकी ज़रूरत नहीं: यह दृश्य को पहले से ही समझता है, इसलिए prompt ही विनिर्देश है।

एक मेट्रो के जोड़ने वाले गलियारे की दीवार से टिका एक व्यक्ति स्लीपिंग बैग में करवट लेकर लेटा है, उसके बग़ल में एक सूटकेस और एक कैरियर बैग है।
एक prompt, एक इवेंट-वर्ग। प्लेटफ़ॉर्म फ़र्श पर मौजूद एक व्यक्ति की रिपोर्ट करता है; यह असल में क्या निकलता है, यह तय करना ऑपरेटर का काम है।

यूज़-केस लाइब्रेरी

24 StreamVLM यूज़-केस और संबंधित एनालिटिक्स

24 prompt से परिभाषित स्थितियों को देखें, हर एक के साथ एक उदाहरणात्मक कैमरा-छवि और एक समर्पित पेज। एक संबंधित प्रशिक्षित दोपहिया वर्कफ़्लो इस विज़ुअल लाइब्रेरी को पूरा करता है।

यह कैसे अलग है

हर समस्या के लिए एक module नहीं, बल्कि एक ही इंजन

कोई ट्रेनिंग-पाइपलाइन नहीं

कोई डेटा-संग्रह नहीं, कोई लेबलिंग नहीं, हर यूज़-केस के लिए अलग मॉडल नहीं। एक नया डिटेक्टर बस एक वाक्य है, और यह उसी क्षण से काम करता है जब आप इसे सेव करते हैं।

एक इंजन, असीमित परिदृश्य

कई legacy modules को बदलने और एक साथ लाने के लिए डिज़ाइन किया गया, जिनमें आग-पहचान, वीडियो-क्वालिटी मॉनिटरिंग, और टैम्पर-पहचान शामिल हैं।

हर डिटेक्टर के लिए ट्यून-योग्य

कॉन्फ़िडेंस थ्रेशोल्ड, अलर्ट कूलडाउन, और इवेंट-प्रकार अलग-अलग सेट किए जाते हैं, ताकि कोई शोर-भरी स्थिति ऑपरेटर को अलर्ट से न भर दे।

बाक़ी सब कुछ की तरह ही लॉग होता है

हर prompt, विश्लेषित फ़्रेम, अलर्ट, और एजेंट-कार्रवाई को टाइमस्टैंप, ऑपरेटर की पहचान, और Case ID के साथ, भूमिका-आधारित एक्सेस के तहत लॉग किया जाता है।

खोज और डैशबोर्ड को फ़ीड करता है

StreamVLM के इवेंट उन्हीं तीन मोड में प्रवाहित होते हैं जिनमें क्लासिक modules के: रियल-टाइम अलर्ट, आर्काइव पर जाँच, और बिग-डेटा एक्सपोर्ट।

पूर्वाग्रह-सुरक्षा उपाय लागू होते हैं

prompt से परिभाषित डिटेक्टर उसी एथिक्स फ़्रेमवर्क के भीतर बैठता है जिसमें प्रशिक्षित modules, जिसमें संकीर्ण-सीमा नियम भी शामिल है।

FAQ

क्या StreamVLM हमारे instance पर उपलब्ध है?

StreamVLM ग्राहक के instance में GPU नोड पर चलता है। कोई विशिष्ट डिप्लॉयमेंट इसके दायरे में है या नहीं, यह पहले से वादा नहीं किया जाता बल्कि IREX इंजीनियरिंग के साथ पुष्टि की जाती है।

क्या इसके लिए अतिरिक्त शुल्क लगता है?

नहीं। StreamVLM मानक IREX मूल्य में शामिल है, बिना किसी अलग लाइसेंस, module या सब्सक्रिप्शन शुल्क के। जहाँ किसी डिप्लॉयमेंट को VLM इन्फरेंस के लिए स्थानीय GPU नोड चाहिए, उस नोड का आकार और मूल्य IREX इंजीनियरिंग के साथ तय होता है।

एक कैमरा कितने डिटेक्टर चला सकता है?

कई। एक कैमरा-चैनल एक साथ कई prompt से परिभाषित डिटेक्टर ले जाता है, हर एक का अपना कॉन्फ़िडेंस थ्रेशोल्ड, अलर्ट कूलडाउन, और इवेंट-प्रकार। IREX अभी तक कोई प्रति-कैमरा सीमा प्रकाशित नहीं करता: यह सघनता कैसे बढ़ती है यह ग्राहक के हार्डवेयर पर निर्भर करता है, और इसे पायलट के दौरान आपके अपने कैमरों पर मापा जाता है।

क्या यह हमारे मौजूदा एनालिटिक्स modules की जगह ले सकता है?

यह उनमें से कई को एक साथ लाने के लिए डिज़ाइन किया गया है, जिनमें आग-पहचान, वीडियो-क्वालिटी मॉनिटरिंग, और टैम्पर-पहचान शामिल हैं। प्रशिक्षित हाई-फ़्रेम-रेट डिटेक्टर तेज़ गति से लोगों और वाहनों को ट्रैक करने के लिए अब भी सही उपकरण बने रहते हैं।

StreamVLM के पीछे कौन-सा मॉडल है, और यह कहाँ तक पहुँच सकता है?

किसी तीसरे पक्ष द्वारा प्रकाशित एक ओपन-वेट विज़न-लैंग्वेज मॉडल, और जैसा प्रकाशित हुआ वैसा ही उपयोग किया गया: IREX न तो इसे फ़ाइन-ट्यून करता है और न ही इसके वेट बदलता है, इसे वर्ज़न और चेकसम से पिन करता है, और इसे केवल आपके instance के भीतर, उस instance के अपने GPU नोड पर, नामित एंडपॉइंट पर परोसता है। कोई फ़्रेम, prompt या फ़ैसला instance से बाहर नहीं जाता, और किसी भी क्षेत्र में किसी भी instance पर कोई थर्ड-पार्टी क्लाउड इन्फरेंस उपयोग नहीं होता। मॉडल कोई टूल-कॉल नहीं करता, फ़्रेम के बीच कोई मेमोरी नहीं रखता, इसकी आर्काइव, इवेंट-डेटाबेस, वॉचलिस्ट, अन्य कैमरों या नेटवर्क तक कोई पहुँच नहीं है, और इसमें कोई बायोमेट्रिक फ़ंक्शन नहीं है: यह दृश्यों और स्थितियों का आकलन करता है और किसी व्यक्ति की पहचान नहीं कर सकता। IREX यह प्रकाशित नहीं करता कि यह कौन-सा मॉडल है; इसकी पहचान, वर्ज़न और चेकसम किसी ग्राहक को NDA के तहत बताए जाते हैं, क्योंकि नाम बताया गया मॉडल एक हमला-सतह और एक ऐसा तथ्य है जो पुराना पड़ जाता है। सार्वजनिक AI Model Governance Policy का भाग B यह सब स्पष्ट करता है।

बताएँ कि आपको क्या देखना है

वे स्थितियाँ लाएँ जिनकी आपके शहर को वास्तव में चिंता है। अगर कोई prompt उसका वर्णन कर सकता है, तो हम आमतौर पर पायलट में आपको उसके लिए एक डिटेक्टर दिखा सकते हैं।

डेमो बुक करें