Beszélgetéssel szerkeszthetők a vállalati videók a Google új AI-modelljével
A Google Gemini Omni Flash API-n keresztül már elérhető, forradalmasítva a vállalati videógyártást: a modell beszélgetéssel szerkeszti a videókat, csökkentve a költségeket és időt.

A Google a Gemini Omni Flash modellel igyekszik átírni a vállalati videókészítés jelenlegi, költséges és időigényes folyamatait. Az új „Omni” család első tagja most API-n keresztül válik elérhetővé a fejlesztők és vállalati ügyfelek számára, miután 2026 májusában debütált a Google I/O-n. A modell nem csupán szöveges utasításokra képes videót generálni, hanem kész klipeket is képes szerkeszteni beszélgetés útján, anélkül, hogy azokat teljesen újra kellene generálni. (VentureBeat)
A korábbi, több különálló eszközt – szöveg-szkript LLM-et, szöveg-kép modellt, kép-videó modellt, ajakszinkronizáló és hanggeneráló eszközöket – igénylő munkafolyamatokat a Google egyetlen rendszerbe tömöríti. A Gemini Omni Flash képes szöveget, képeket és videókat fogadni, és szinkronizált hanggal ellátott kész klipeket ad vissza. Ez a megközelítés jelentősen leegyszerűsíti a folyamatot, csökkenti a beszállítók számát, és egységes felületet biztosít a kimenet felügyeletére és az adatkezelési szabályok betartatására. A beszélgetés alapú szerkesztés lehetővé teszi, hogy a marketingesek vagy a tanulási és fejlesztési csapatok módosítsanak meglévő felvételeket, anélkül, hogy az egész folyamatot elölről kellene kezdeniük.
Kapcsolódó: Google TV Gemini Nano
A modell nem csak szöveges utasításokat fogad, hanem referenciaképeket és meglévő videoklipeket is képes bemenetként kezelni. Ez lehetővé teszi, hogy a felhasználók specifikus vizuális elemeket, például egy adott tárgyat, márkajelzést vagy logót illesszenek be a videóba. A Google által kiemelt két erősség közé tartozik a fizikai világot leképező „világmodell” és a szöveg-logó beillesztés. A fizikai konzisztencia, mint például az eső és a pocsolyák tükröződése, realisztikusabbá teszi a generált videókat. A szövegek és logók átírása vagy beillesztése hasznos lehet képzési anyagok vagy reklámok esetében, bár a tesztek során a komplex jelenetekben a feliratok követése és a szövegek helyes nyelven maradása nem mindig volt tökéletes.
Kapcsolódó: Google Térkép képaláírások
A technológia az új, többfordulós feladatokra optimalizált „interactions API” interfészen fut. Ez lehetővé teszi a generált klipek lépésenkénti szerkesztését és verziók tárolását. Jelenleg a klipek maximális hossza 10 másodperc, hosszabb videók készítéséhez több részletet kell generálni és összedolgozni. A feltöltött, saját jogú videók is szerkeszthetők, amennyiben azok hossza nem haladja meg a 10 másodpercet. A Google elismeri, hogy a konzisztencia fenntartása és a pontos szövegrenderelés továbbra is nyitott kérdés.
Kapcsolódó: Gemini Google Fotók
A Google gondoskodik a tartalom eredetének nyomon követhetőségéről is. Minden Omni klipp rendelkezik SynthID vízjellel, és a Google kiterjeszti a C2PA tartalomhitelesítést minden generatív eszközére. Emellett egy AI tartalomdetektáló API-t is elindítottak, amely képes felismerni a mesterséges intelligencia által generált médiát. A modell nem képes személyekről készült fotók és hangfelvételek alapján deepfake videók létrehozására, de képes hangfelvételeket más nyelvekre fordítani, ami hasznos lehet a globális képzési tartalmak lokalizálásához.
Kapcsolódó: Veo 3.1 Lite
Az Omni Flash árazása agresszív: másodpercenként 0,10 dollárba kerül a 720p felbontású videók generálása, ami egy 10 másodperces klipet körülbelül 1 dollárra tesz. Ez versenyképes a hasonló szolgáltatásokkal, azonban a modell jelenleg csak 720p felbontást támogat, míg más szolgáltatások kínálnak 1080p és 4K opciókat is. A klipek 3-10 másodpercesek lehetnek fekvő vagy álló formátumban, és a bemeneti videók maximum 3 másodpercesek lehetnek. A kimenet MP4 formátumban érkezik, beépített vízjellel és C2PA hitelesítéssel. A Google a Gemini Omni Flash-t 2026 júniusának végéig teszi széles körben elérhetővé az API-n keresztül.
Kapcsolódó: Gemini autókban