ÉlőUtoljára: az iméntMa: 13
Alkalmazásokfrissítve: 12:17

A Google AI-rendszerrel készít perces videókat, véget vet a koherenciahibáknak

A Google Research új AI-rendszere, az AI Video Co-Director, négy keretrendszerrel képes perces, koherens videókat generálni, megoldva a korábbi modellek identitás- és láncreakciós hibáit.

A Google AI-rendszerrel készít perces videókat, véget vet a koherenciahibáknak
Fotó: Jake Walker / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

A jelenlegi AI-videó-generátorok gyakran elvéreznek a hosszabb történetek összeállításánál. A modulok láncolása és az egymástól független utasítások használata szemantikai sodródást okoz, ami az öltözék vagy a környezet megváltozását eredményezi a jelenetek között. Emellett láncreakciós hibák is felléphetnek, amikor egy rosszul generált részlet az egész videót tönkreteszi. A Google kutatói ezt hitelrontási problémaként fogalmazzák meg, ahol nehéz visszavezetni a hibát a kiinduló promptra. (MarkTechPost)

A Google AI Video Co-Director működése

A rendszer a Gemini és a Veo modellekre épül, de modell-agnóztikus, így más generátorokkal is használható. Az így készült videók öröklik az alapmodellek SynthID vízjelét. A rendszer négy fő keretrendszerből áll: Co-Director, CANVAS, A²RD és VQQA.

Co-Director: Kreatív tervezés bandit kereséssel

A COLM 2026 konferencián elfogadott Co-Director egy multi-armed bandit (MAB) algoritmust használ. Egy Orchestrator Agent választja ki a kreatív stratégiát, narratív módot és esztétikai archetípust. Ezt követően egy Pre-Production Agent készíti el a storyboardot, majd a Keyframe, Video és Audio alügynökök állítják elő a médiát. Végül egy MLLM Judge pontozza az eredményt, és visszajelzést küld a banditnak.

CANVAS: Perzisztens vizuális memória

Az EMNLP 2026 konferencián elfogadott CANVAS követi a karakterek, helyszínek és tárgyak állapotát a történet során. Amikor egy jelenet visszatér, a rendszer lekéri a korábban tárolt vizuális horgonyokat. A Google múzeumi tesztjében a CANVAS biztosította, hogy a tolvaj sapkája és az ékkő következetes maradt a jelenetek között, ellentétben más modellekkel.

A²RD: Szegmensről szegmensre haladó videók

Az A²RD (Agentic Autoregressive Diffusion) egy betanítás-mentes architektúra. Minden szegmens egy Retrieve, Synthesize, Refine, Update ciklust futtat egy multimodális videómemória ellenében. Az ügynök vált az új történeti elemek ekstrapolációja és a visszatérő entitások interpolációja között. Ezzel a módszerrel a Google egy 10 perces filmet generált.

VQQA: Zártkörű prompt finomítás

A VQQA (Video Quality Question Answering) vizuális kérdéseket generál minden promptra. A VLM kritikák „szemantikai gradiensként” szolgálnak, amelyek átírják a szöveges utasítást, anélkül, hogy hozzáférnének a modell belső működéséhez. Egy globális kiválasztási lépés pedig a legjobb videót választja ki az iterációk közül.

Eredmények és összehasonlítás

A Google három új teljesítménytesztet hozott létre: a GenAD-Bench (400 reklámforgatókönyv), a HardContinuityBench (jelenetek és tárgyak ismétlődése) és a LVBench-C (120 forgatókönyv). A Co-Director 81,4-es átlagot ért el a GenAD-Benchen, és 3,96/5 pontot emberi értékelésen. A CANVAS 21,6%-kal javította a háttérfolytonosságot, az A²RD pedig akár 30%-kal jobb konzisztenciát és 20%-kal jobb narratív koherenciát mutatott. A VQQA 11,57%-os, illetve 8,43%-os javulást ért el a T2V-CompBenchen és a VBench2-n.

A Co-Director és az A²RD kódja elérhető a GitHubon, a CANVAS kódja pedig hamarosan érkezik.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom