Akár 88%-kal csökkenti a tokenfogyasztást a Google DeepMind új videóelemző AI-ja
A Google DeepMind új agentikus videóértelmezési funkciója akár 88%-kal csökkenti a tokenfogyasztást és 66%-kal a költségeket, miközben 7%-kal javítja a pontosságot a videóelemzésnél.

A korábbi, fix képkocka-sebességű feldolgozással ellentétben az agentikus videóértelmezés a modell alapvető érvelését a natív videós eszközökkel kombinálja. Ez lehetővé teszi a célzott videószegmensek dinamikus keresését, vizsgálatát és ellenőrzését vizuális képkockákon, hangon és átiratokon keresztül. (Google DeepMind)
Hatékonyabb elemzés hosszú videóknál
Az újítás különösen a hosszú videótartalmak — 10 perces útmutatóktól a többórás felvételekig — feldolgozásánál mutatkozik meg. A statikus feldolgozásnál a fejlesztőknek választaniuk kell a magas tokenköltségek vagy a kritikus részletek elvesztésével járó módszerek között. Az agentikus videóértelmezés aktiválásával a Gemini 3.7 Flash akár 88%-kal csökkenti a tokenfogyasztást és 7%-kal növeli a pontosságot.
A Gemini 3.7 Flash az élvonalban
A támogatott modellek közül a Gemini 3.7 Flash nyújtja a legjobb minőséget és a legjobb minőség-költség arányt, ezzel az accuracy-to-cost pareto frontier-re kerül a videóértelmezés terén. Az agentikus videóértelmezés lehetővé teszi az alig másodperces pillanatok visszakeresését, pontosabb anomáliadetektálást, precíz számlálást és dinamikus videószkennelést.
A funkció ma elérhetővé vált a Gemini API-n keresztül a Google AI Studióban és a Gemini Enterprise Agent Platformon. A Gemini 3.7 Flash, 3.6 Flash és 3.5 Flash-Lite modellekhez kínált megoldás a szokásos Gemini API tokenárazást használja, további funkció díj nélkül. A Google termékeiben is megjelenik a funkció, többek között a YouTube „Ask YouTube” funkcióját fogja erősíteni a videókatételekkel kapcsolatos válaszok minőségének javítása érdekében.