ÉlőUtoljára: 15 perceMa: 14
Alkalmazásokfrissítve: 11:15

A Runway AI-videógenerátorában a hibát funkcióvá alakították

A Runway Characters valós idejű videómodelljében az AI-generált avatárok elmozdultak a középpontból; ezt a hibát Ryan Phillips szerint új front-end funkcióval kerültek meg.

A Runway AI-videógenerátorában a hibát funkcióvá alakították
Fotó: Egor Komarov / Unsplash
forrás: VentureBeat·AI Forradalom szerk.·
Megosztás

A Runway ML fejlesztői egy makacs hibával küzdöttek heteken át: a mesterséges intelligencia által generált avatárok elmozdultak a középponttól valós idejű videók készítése közben. A megoldás nem egy háttérfolt, hanem egy új front-end funkció lett, amely megkerülte a problémát. (VentureBeat)

Ryan Phillips, a Runway ML vállalati termékekért felelős vezetője szerint a tapasztalatok hasznosak lehetnek más cégek számára is, még ha nem is alapmodelleket fejlesztenek. A Runway mesterséges intelligenciával működő, általános világmodelleket épít generatív eszközök meghajtására. A Runway Characters valós idejű videómodellje zökkenőmentes, interaktív videókészítést tesz lehetővé AI-generált avatárokkal.

Minőségértékelés és tesztelés

Egy robusztus AI-termék létrehozása magas minőségű értékelési készlettel kezdődik, amihez mély, több funkciót átfogó egyeztetés szükséges a termék, a dizájn, a kutatás és az értékesítés között. Phillips hangsúlyozta a belső workshopok fontosságát, ahol a csapattagok közösen vizsgálják meg a generált példákat, hogy egységes definíciót alakítsanak ki a sikeres generálásról. A tesztelés során figyelembe veszik a széles körű felhasználói eseteket és az extrém, ritka helyzeteket is, mint például egy orr nélküli, nem emberi karakter, a „Tooth” tesztelése.

A Runway egyszerű Excel táblázatot használ az értékelések nyomon követésére, ahol a kimeneteket „kisebb” vagy „nagyobb” hibaként kategorizálják egy előre meghatározott elfogadási arány ellenében. „Beállítunk egy határt, mielőtt elkezdenénk, hogy mekkora százalékot kell teljesítenünk, és amikor elérjük, kiadjuk a modellt” – mondta Phillips. A manuális értékelés skálázási problémáit a nyelvi modellek (LLM-ek) segítségével automatizálják a vizuális minőségértékeléshez.

Technikai háttér és infrastruktúra

A valós idejű generatív videó létrehozása rendkívül optimalizált technikai hátteret igényel. A Runway a „tanítvány” modell képzésével éri el a valós idejű sebességet, ami a generálási idő 80-90%-át csökkenti. Ezt követően az úgynevezett „adversarial post-training” (APT) technikát alkalmazzák, amely folyamatosan teszteli a modellt annak hibáinak felderítésére.

A modell architektúrájának módosítása új problémákat vetett fel: a karakterek elmozdultak a kép közepéről. Miután hetekig próbálták kijavítani a magmodellt, felfedezték, hogy ha a felhasználó eredeti bemeneti képe tökéletesen középre van igazítva, a generált videó stabil marad. Ahelyett, hogy háttérmódosítással próbálkoztak volna, a Runway egy felhasználói élmény megoldást vezetett be: „Optimize for Image Quality” funkciót, amely automatikusan középre igazítja a felhasználó képét a generálás előtt. Ezzel a korlátot termékfunkcióvá alakították.

A globális, másodpercenként 24 képkockás videószolgáltatás minden infrastruktúraréteg optimalizálását igényli. A Runway nemrégiben észlelte, hogy API-hívások 8%-az akadozott, ami a videó szaggatását okozta. A probléma gyökerének felderítéséhez AI-ügynököt használtak a Claude modelljével, valamint olyan monitorozó eszközöket, mint a Datadog és a Sentry. A hibát egyetlen adatközpontban lokalizálták, ahol fizikai GPU-cserékkel oldották meg a problémát.

A valós idejű alkalmazásokat telepítő vállalati csapatok számára a tanulság az, hogy a hardver- és infrastruktúra-anomáliák közvetlenül befolyásolják a modell teljesítményét, ami szigorú, teljes körű hibakeresési képességeket igényel. Phillips szerint a részletekre való odafigyelés kulcsfontosságú a modellek telepítésekor.

Forrás

Feldolgozott sajtóforrás·VentureBeat

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom