Az intelligens VMS és PSIM szoftverek világelső fejlesztője
Hol tudja megvenni
Kapcsolatfelvétel

Vision-Language Model (VLM) a szemantikai videódetektáláshoz és -kereséshez

Mi lenne, ha a videókezelő rendszere azonnal fel tudna ismerni komplex jeleneteket csupán azáltal, hogy közérthető nyelven leírja azokat? Az Axxon One Vision-Language Model (VLM) segítségével a felhasználók az intuitív, természetes nyelvi lekérdezések használatával állíthatnak be valós idejű objektum- és eseménydetektálást.

Az Axxon One-ban található VLM támogatja a visszamenőleges keresést is. Amikor ez a funkció engedélyezve van, a rendszer eltárolja a videórögzítés során a neurális hálózat által generált jelenetleírásokat, és elérhetővé teszi azokat a későbbi kereséshez. Ez lehetővé teszi a felhasználók számára, hogy egyetlen AI-alapú munkafolyamaton belül dolgozzanak az élő detektálással és az archívumkereséssel.

Valós idejű szemantikai detektálás VLM-mel

Egyszerűen írja le, mit szeretne detektálni — legyen az „egy futó ember” vagy „egy fekete ruhát viselő nő”. Az AI-alapú Meta-Detector VLM feldolgozza a lekérdezést, és azonosítja a egyező jeleneteket, amint azok megjelennek a videófolyamban, zökkenőmentes és pontos jelenetdetektálást kínálva. Keresési módban a felhasználó beír egy szöveges lekérdezést, a rendszer pedig lefordítja azt a neurális hálózat által használt metaadat-ábrázolásra, hogy megtalálja a legközelebbi egyezéseket.

Real-time scene recognition

Valós idejű jelenetfelismerés

Észleljen specifikus objektumokat és eseményeket, amint azok megtörténnek, és kapjon riasztásokat, amikor egy szöveges lekérdezés megegyezik az élő videóban lévő jelenet leírásával.

Flexible query structure

Rugalmas lekérdezési struktúra

Kombinálja az objektumokat, a tulajdonságokat (méret, szín stb.), a környezetet és a pozicionálást a pontos detektálás érdekében.

No additional training required

Nincs szükség további tanításra

A neurális hálózat az alapértelmezett beállításokkal is megérti a különféle forgatókönyveket, segítve a felhasználókat az élő riasztásokkal és a visszamenőleges kereséssel való munkában anélkül, hogy minden egyes feladathoz egyedi modelleket kellene létrehozniuk.

A VLM áthidalja az emberi szándék és a gépi végrehajtás közötti szakadékot

Összetett szabályok konfigurálása helyett egyszerűen leírja, mire van szüksége, a rendszer pedig elvégzi a többit. Ez elérhetőbbé, rugalmasabbá és a változó működési igényekhez könnyebben igazíthatóvá teszi a videóanalitikát.

Élő módban a Meta-Detector VLM online eszközként működik: a felhasználó beír egy szöveges lekérdezést, és riasztást kap, ha ez a lekérdezés valós időben megegyezik a képkocka leírásával.

A visszamenőleges kereséshez a felhasználók engedélyezhetik a metaadatok tárolását a Meta-Detector oldalán. Ez elérhetővé teszi a képkockák leírásait a későbbi archívumkereséshez anélkül, hogy előre konfigurálni kellene bármilyen detektort. A keresés a videórögzítés során a neurális hálózat által generált összes tárolt metaadaton keresztül történik.

Példák a detektálásra

  • Észleljen „a bejáratnál hagyott csomagot”.
  • Azonosítson „a rakodórámpa közelében kerítésre mászó személyt”.
  • Ismerjen fel „egy fehér autót a kijelölt gyalogos-átkelőhelyen, felülnézetből”.
  • Keressen a rögzített felvételek között „rózsaszínt viselő személyre”.

Meta-Search a rögzített videókban

A metaadat-tárolás engedélyezése után a felhasználók megnyithatják a keresés fület, kiválaszthatják a Meta-Search VLM-et, és ugyanúgy, intuitív módon dolgozhatnak vele, mint a detektorbeállításoknál. Beírnak egy szöveges lekérdezést, a rendszer pedig visszaadja azokat a képkockákat és videórészleteket, amelyek tárolt metaadatai a legjobban megfelelnek az adott kérésnek.

A felhasználók a hasonlóságot százalékos arányban is beállíthatják a keresési eredmények pontosítása érdekében. Ez lehetővé teszi az egyezés bővítését vagy szűkítését attól függően, hogy mennyire specifikus a lekérdezés, és hány releváns eredményre van szükség.

A Meta-search önmagában nem generál eseményeket. Szerepe az, hogy a korábban tárolt metaadatokat használja a visszamenőleges visszakereséshez. Ha dedikált detektorok már be vannak konfigurálva és valós időben generálnak eseményeket, akkor a keresés ezeken az eseményeken keresztül is elvégezhető.

A VLM értéke az Axxon One VMS-ben

Az AI-vezérelt Vision-Language Model képességei a hagyományos megfigyelőrendszereket intelligensebb, rugalmasabb videókezelő platformokká alakítják. Az élő szemantikai detektálást biztosító Meta-Detector VLM és az archívumból való visszakeresést szolgáló Meta-Search VLM kombinálásával az Axxon One lehetővé teszi:

  • A valós idejű jelenetmegértést az élő videófolyamoknál.
  • A gyorsabb reakcióidőt a biztonsági fenyegetésekre.
  • A jobb pontosságot a komplex jelenetek azonosításában.
  • A kevesebb időráfordítást a manuális felülvizsgálatra és konfigurációra.

Azáltal, hogy lehetővé teszi a felhasználók számára, hogy ember által olvasható leírásokon keresztül lépjenek interakcióba mind az élő, mind a rögzített videókkal, az Axxon One VLM hatékony megközelítést biztosít a valós idejű jelenetmegértéshez és az AI-alapú archívumkereséshez. Ez kiterjeszti a videóanalitikát az eseménydetektálástól a szemantikai videómegértés felé egy teljes VMS munkafolyamaton belül.

Műszaki specifikációk

Az Axxon One VMS alapfunkcióinak, speciális jellemzőinek, a videóelemzésnek, valamint a támogatott eszközöknek és szabványoknak egy áttekintő táblázatos nézete

Specifikációk megtekintése
Bemutató

A teljes Axxon One prezentáció PDF változata, amely részletes információkat tartalmaz a fejlett videókezelő szoftverünkről.

Letöltés .pdf
Brosúra

Részletes információk az Axxon One VMS funkcióiról és technológiáiról PDF formátumban

Letöltés .pdf