A Google AI-rendszerrel készít perces videókat, véget vet a koherenciahibáknak
A Google Research új AI-rendszere, az AI Video Co-Director, négy keretrendszerrel képes perces, koherens videókat generálni, megoldva a korábbi modellek identitás- és láncreakciós hibáit.

A jelenlegi AI-videó-generátorok gyakran elvéreznek a hosszabb történetek összeállításánál. A modulok láncolása és az egymástól független utasítások használata szemantikai sodródást okoz, ami az öltözék vagy a környezet megváltozását eredményezi a jelenetek között. Emellett láncreakciós hibák is felléphetnek, amikor egy rosszul generált részlet az egész videót tönkreteszi. A Google kutatói ezt hitelrontási problémaként fogalmazzák meg, ahol nehéz visszavezetni a hibát a kiinduló promptra. (MarkTechPost)
A Google AI Video Co-Director működése
A rendszer a Gemini és a Veo modellekre épül, de modell-agnóztikus, így más generátorokkal is használható. Az így készült videók öröklik az alapmodellek SynthID vízjelét. A rendszer négy fő keretrendszerből áll: Co-Director, CANVAS, A²RD és VQQA.
Co-Director: Kreatív tervezés bandit kereséssel
A COLM 2026 konferencián elfogadott Co-Director egy multi-armed bandit (MAB) algoritmust használ. Egy Orchestrator Agent választja ki a kreatív stratégiát, narratív módot és esztétikai archetípust. Ezt követően egy Pre-Production Agent készíti el a storyboardot, majd a Keyframe, Video és Audio alügynökök állítják elő a médiát. Végül egy MLLM Judge pontozza az eredményt, és visszajelzést küld a banditnak.
CANVAS: Perzisztens vizuális memória
Az EMNLP 2026 konferencián elfogadott CANVAS követi a karakterek, helyszínek és tárgyak állapotát a történet során. Amikor egy jelenet visszatér, a rendszer lekéri a korábban tárolt vizuális horgonyokat. A Google múzeumi tesztjében a CANVAS biztosította, hogy a tolvaj sapkája és az ékkő következetes maradt a jelenetek között, ellentétben más modellekkel.
A²RD: Szegmensről szegmensre haladó videók
Az A²RD (Agentic Autoregressive Diffusion) egy betanítás-mentes architektúra. Minden szegmens egy Retrieve, Synthesize, Refine, Update ciklust futtat egy multimodális videómemória ellenében. Az ügynök vált az új történeti elemek ekstrapolációja és a visszatérő entitások interpolációja között. Ezzel a módszerrel a Google egy 10 perces filmet generált.
VQQA: Zártkörű prompt finomítás
A VQQA (Video Quality Question Answering) vizuális kérdéseket generál minden promptra. A VLM kritikák „szemantikai gradiensként” szolgálnak, amelyek átírják a szöveges utasítást, anélkül, hogy hozzáférnének a modell belső működéséhez. Egy globális kiválasztási lépés pedig a legjobb videót választja ki az iterációk közül.
Eredmények és összehasonlítás
A Google három új teljesítménytesztet hozott létre: a GenAD-Bench (400 reklámforgatókönyv), a HardContinuityBench (jelenetek és tárgyak ismétlődése) és a LVBench-C (120 forgatókönyv). A Co-Director 81,4-es átlagot ért el a GenAD-Benchen, és 3,96/5 pontot emberi értékelésen. A CANVAS 21,6%-kal javította a háttérfolytonosságot, az A²RD pedig akár 30%-kal jobb konzisztenciát és 20%-kal jobb narratív koherenciát mutatott. A VQQA 11,57%-os, illetve 8,43%-os javulást ért el a T2V-CompBenchen és a VBench2-n.
A Co-Director és az A²RD kódja elérhető a GitHubon, a CANVAS kódja pedig hamarosan érkezik.