6,8 másodperc alatt készít 10 másodperces videót a LTX-2.5
A LTX-2.5 modell két Nvidia GB200 chipen 6,8 másodperc alatt hoz létre 10 másodperces, 720p felbontású videót egy képből. A modell nyílt súlyú, és ingyenesen használható 10 millió dollár alatti éves bevételű cégeknek.

Az LTX kiadta legújabb, nyílt súlyú videó- és „világmodelljét”, a LTX-2.5-öt. A modell natívan integrálódott a ComfyUI-ba, a nyílt generatív média prototípus-környezetévé vált node-alapú munkafolyamat-eszközbe. A modell elérhető a Hugging Face-on, a ComfyUI-ban, valamint az LTX API-n keresztül. A 10 millió dollár alatti éves bevételű szervezetek számára ingyenesen használható, nagyobb cégekkel pedig licencszerződést kötnek. (VentureBeat)
Az LTX szerint modelljeik több mint 33 millió letöltést értek el, ezzel az LTX család a legnépszerűbb „open world” modellcsalád a piacon. Zeev Farbman vezérigazgató szerint a cél a sebesség és hatékonyság fenntartása mellett a minőség folyamatos emelése. Az új kiadás többek között multi-shot támogatást, jobb minőséget biztosító diffúziós dekódert, új kondicionálási módokat és robotikai felhasználásokhoz kritikus autoregresszív modellek jobb támogatását hozza.
Újdonságok a LTX-2.5-ben
A LTX-2.5 a generációs folyamat szinte minden szakaszát újraépíti. Főbb változások: új diffúziós videódekóder a vizuális artefaktumok csökkentésére és a finom részletek, mint a szöveg és arcok rekonstruálására, miközben megőrzi az LTX magas tömörítési arányát. Natív multishot generálás, amely egyetlen kimenetként renderel egy teljes szekvenciát, karaktert, jelenetet és hangot tartva konzisztensen a vágások között.
Egyedi Gemma 4 nyelvi gerinc és dedikált prompt-enhancer az összetett, több témát érintő utasítások pontosabb kezeléséhez. Fizikai AI-ra és robotikára hangolt előbetanított checkpoint, amely alapot ad a domain-specifikus adatok finomhangolásához. Továbbfejlesztett, desztillált modell, amely közel teljes modellminőséget kínál alacsonyabb költséggel és gyorsabb következtetéssel, és az NVIDIA-val való optimalizálás révén helyileg futtatató NVIDIA RTX GPU-kon csökkentett memóriakövetelményekkel.
Sebesség és minőség
A LTX-2.5 két NVIDIA GB200 chipen 6,8 másodperc alatt generál egy 10 másodperces, 720p felbontású videót képből. Ugyanez az LTX API-n keresztül 23,7 másodpercet vesz igénybe, magasabb, 1080p felbontás mellett. Az LTX szerint a LTX-2.5 nagyjából nyolcadannyi költséggel és hetedannyi renderelési idővel dolgozik, mint a hasonló modellek, kimenete pedig adatközponti GPU-któl kezdve Mac-ig bármilyen hardveren futtatható.
A LTX-2.5 generálási sebességét összehasonlítva a Google Gemini Omni Flash 52 másodpercet, az xAI Grok 1.5 63 másodpercet, a Google Veo 3.1 70 másodpercet (egy 8 másodperces kliphez), a MiniMax H3 180 másodpercet, a ByteDance Seedance 2.5 317 másodpercet, a Kuaishou Kling 3.0 Pro pedig 398 másodpercet ért el.
Minőség tekintetében a LTX-2.5 67%-os győzelmi arányt ért el vak, egymás melletti emberi preferenciateszteken. A LTX-2.5 16 GB VRAM-mal futtatható, on-premises, edge vagy API-n keresztül telepíthető, és ügyfelek saját adataikon finomhangolhatják.