A Runway AI-videógenerátorában a hibát funkcióvá alakították
A Runway Characters valós idejű videómodelljében az AI-generált avatárok elmozdultak a középpontból; ezt a hibát Ryan Phillips szerint új front-end funkcióval kerültek meg.

A Runway ML fejlesztői egy makacs hibával küzdöttek heteken át: a mesterséges intelligencia által generált avatárok elmozdultak a középponttól valós idejű videók készítése közben. A megoldás nem egy háttérfolt, hanem egy új front-end funkció lett, amely megkerülte a problémát. (VentureBeat)
Ryan Phillips, a Runway ML vállalati termékekért felelős vezetője szerint a tapasztalatok hasznosak lehetnek más cégek számára is, még ha nem is alapmodelleket fejlesztenek. A Runway mesterséges intelligenciával működő, általános világmodelleket épít generatív eszközök meghajtására. A Runway Characters valós idejű videómodellje zökkenőmentes, interaktív videókészítést tesz lehetővé AI-generált avatárokkal.
Minőségértékelés és tesztelés
Egy robusztus AI-termék létrehozása magas minőségű értékelési készlettel kezdődik, amihez mély, több funkciót átfogó egyeztetés szükséges a termék, a dizájn, a kutatás és az értékesítés között. Phillips hangsúlyozta a belső workshopok fontosságát, ahol a csapattagok közösen vizsgálják meg a generált példákat, hogy egységes definíciót alakítsanak ki a sikeres generálásról. A tesztelés során figyelembe veszik a széles körű felhasználói eseteket és az extrém, ritka helyzeteket is, mint például egy orr nélküli, nem emberi karakter, a „Tooth” tesztelése.
A Runway egyszerű Excel táblázatot használ az értékelések nyomon követésére, ahol a kimeneteket „kisebb” vagy „nagyobb” hibaként kategorizálják egy előre meghatározott elfogadási arány ellenében. „Beállítunk egy határt, mielőtt elkezdenénk, hogy mekkora százalékot kell teljesítenünk, és amikor elérjük, kiadjuk a modellt” – mondta Phillips. A manuális értékelés skálázási problémáit a nyelvi modellek (LLM-ek) segítségével automatizálják a vizuális minőségértékeléshez.
Technikai háttér és infrastruktúra
A valós idejű generatív videó létrehozása rendkívül optimalizált technikai hátteret igényel. A Runway a „tanítvány” modell képzésével éri el a valós idejű sebességet, ami a generálási idő 80-90%-át csökkenti. Ezt követően az úgynevezett „adversarial post-training” (APT) technikát alkalmazzák, amely folyamatosan teszteli a modellt annak hibáinak felderítésére.
A modell architektúrájának módosítása új problémákat vetett fel: a karakterek elmozdultak a kép közepéről. Miután hetekig próbálták kijavítani a magmodellt, felfedezték, hogy ha a felhasználó eredeti bemeneti képe tökéletesen középre van igazítva, a generált videó stabil marad. Ahelyett, hogy háttérmódosítással próbálkoztak volna, a Runway egy felhasználói élmény megoldást vezetett be: „Optimize for Image Quality” funkciót, amely automatikusan középre igazítja a felhasználó képét a generálás előtt. Ezzel a korlátot termékfunkcióvá alakították.
A globális, másodpercenként 24 képkockás videószolgáltatás minden infrastruktúraréteg optimalizálását igényli. A Runway nemrégiben észlelte, hogy API-hívások 8%-az akadozott, ami a videó szaggatását okozta. A probléma gyökerének felderítéséhez AI-ügynököt használtak a Claude modelljével, valamint olyan monitorozó eszközöket, mint a Datadog és a Sentry. A hibát egyetlen adatközpontban lokalizálták, ahol fizikai GPU-cserékkel oldották meg a problémát.
A valós idejű alkalmazásokat telepítő vállalati csapatok számára a tanulság az, hogy a hardver- és infrastruktúra-anomáliák közvetlenül befolyásolják a modell teljesítményét, ami szigorú, teljes körű hibakeresési képességeket igényel. Phillips szerint a részletekre való odafigyelés kulcsfontosságú a modellek telepítésekor.