Vision-Language Model (VLM) a szemantikai videódetektáláshoz és -kereséshez
Mi lenne, ha a videókezelő rendszere azonnal fel tudna ismerni komplex jeleneteket csupán azáltal, hogy közérthető nyelven leírja azokat? Az Axxon One Vision-Language Model (VLM) segítségével a felhasználók az intuitív, természetes nyelvi lekérdezések használatával állíthatnak be valós idejű objektum- és eseménydetektálást.
Az Axxon One-ban található VLM támogatja a visszamenőleges keresést is. Amikor ez a funkció engedélyezve van, a rendszer eltárolja a videórögzítés során a neurális hálózat által generált jelenetleírásokat, és elérhetővé teszi azokat a későbbi kereséshez. Ez lehetővé teszi a felhasználók számára, hogy egyetlen AI-alapú munkafolyamaton belül dolgozzanak az élő detektálással és az archívumkereséssel.
Valós idejű szemantikai detektálás VLM-mel
Egyszerűen írja le, mit szeretne detektálni — legyen az „egy futó ember” vagy „egy fekete ruhát viselő nő”. Az AI-alapú Meta-Detector VLM feldolgozza a lekérdezést, és azonosítja a egyező jeleneteket, amint azok megjelennek a videófolyamban, zökkenőmentes és pontos jelenetdetektálást kínálva. Keresési módban a felhasználó beír egy szöveges lekérdezést, a rendszer pedig lefordítja azt a neurális hálózat által használt metaadat-ábrázolásra, hogy megtalálja a legközelebbi egyezéseket.
Valós idejű jelenetfelismerés
Észleljen specifikus objektumokat és eseményeket, amint azok megtörténnek, és kapjon riasztásokat, amikor egy szöveges lekérdezés megegyezik az élő videóban lévő jelenet leírásával.
A VLM áthidalja az emberi szándék és a gépi végrehajtás közötti szakadékot
Összetett szabályok konfigurálása helyett egyszerűen leírja, mire van szüksége, a rendszer pedig elvégzi a többit. Ez elérhetőbbé, rugalmasabbá és a változó működési igényekhez könnyebben igazíthatóvá teszi a videóanalitikát.
Élő módban a Meta-Detector VLM online eszközként működik: a felhasználó beír egy szöveges lekérdezést, és riasztást kap, ha ez a lekérdezés valós időben megegyezik a képkocka leírásával.
A visszamenőleges kereséshez a felhasználók engedélyezhetik a metaadatok tárolását a Meta-Detector oldalán. Ez elérhetővé teszi a képkockák leírásait a későbbi archívumkereséshez anélkül, hogy előre konfigurálni kellene bármilyen detektort. A keresés a videórögzítés során a neurális hálózat által generált összes tárolt metaadaton keresztül történik.
Példák a detektálásra
- Észleljen „a bejáratnál hagyott csomagot”.
- Azonosítson „a rakodórámpa közelében kerítésre mászó személyt”.
- Ismerjen fel „egy fehér autót a kijelölt gyalogos-átkelőhelyen, felülnézetből”.
- Keressen a rögzített felvételek között „rózsaszínt viselő személyre”.
Meta-Search a rögzített videókban
A metaadat-tárolás engedélyezése után a felhasználók megnyithatják a keresés fület, kiválaszthatják a Meta-Search VLM-et, és ugyanúgy, intuitív módon dolgozhatnak vele, mint a detektorbeállításoknál. Beírnak egy szöveges lekérdezést, a rendszer pedig visszaadja azokat a képkockákat és videórészleteket, amelyek tárolt metaadatai a legjobban megfelelnek az adott kérésnek.
A felhasználók a hasonlóságot százalékos arányban is beállíthatják a keresési eredmények pontosítása érdekében. Ez lehetővé teszi az egyezés bővítését vagy szűkítését attól függően, hogy mennyire specifikus a lekérdezés, és hány releváns eredményre van szükség.
A Meta-search önmagában nem generál eseményeket. Szerepe az, hogy a korábban tárolt metaadatokat használja a visszamenőleges visszakereséshez. Ha dedikált detektorok már be vannak konfigurálva és valós időben generálnak eseményeket, akkor a keresés ezeken az eseményeken keresztül is elvégezhető.
A VLM értéke az Axxon One VMS-ben
Az AI-vezérelt Vision-Language Model képességei a hagyományos megfigyelőrendszereket intelligensebb, rugalmasabb videókezelő platformokká alakítják. Az élő szemantikai detektálást biztosító Meta-Detector VLM és az archívumból való visszakeresést szolgáló Meta-Search VLM kombinálásával az Axxon One lehetővé teszi:
- A valós idejű jelenetmegértést az élő videófolyamoknál.
- A gyorsabb reakcióidőt a biztonsági fenyegetésekre.
- A jobb pontosságot a komplex jelenetek azonosításában.
- A kevesebb időráfordítást a manuális felülvizsgálatra és konfigurációra.
Azáltal, hogy lehetővé teszi a felhasználók számára, hogy ember által olvasható leírásokon keresztül lépjenek interakcióba mind az élő, mind a rögzített videókkal, az Axxon One VLM hatékony megközelítést biztosít a valós idejű jelenetmegértéshez és az AI-alapú archívumkereséshez. Ez kiterjeszti a videóanalitikát az eseménydetektálástól a szemantikai videómegértés felé egy teljes VMS munkafolyamaton belül.
Az Axxon One VMS alapfunkcióinak, speciális jellemzőinek, a videóelemzésnek, valamint a támogatott eszközöknek és szabványoknak egy áttekintő táblázatos nézete
A teljes Axxon One prezentáció PDF változata, amely részletes információkat tartalmaz a fejlett videókezelő szoftverünkről.
Részletes információk az Axxon One VMS funkcióiról és technológiáiról PDF formátumban