Új omni-modális AI fut Apple Siliconon: videót generál a MiniMax-H3
A MiniMaxAI új, szöveget, képet, hangot és videót elfogadó multimodális AI-modellje, a MiniMax-H3 immár helyi gépeken is futtatható Apple Siliconon, akár 15 másodperces videókat generálva.

A PipeNetwork által kiadott Python-csomag, a minimax-h3-mlx, teszi lehetővé a modell futtatását Apple Silicon eszközökön. Simon Willison saját M5 Max MacBook Pro-ján tesztelte a rendszert, amelyhez körülbelül 115 GB modellfájlt kellett letölteni.
Teljesítmény és eredmények
A videógenerálás a teszt során majdnem 45 percet vett igénybe. Willison szerint a keletkezett videó „lenyűgöző”, azonban a hanganyag „furcsa, beszédhez hasonló szemétnek” bizonyult, mivel nem adott explicit hangutasításokat a generáláshoz. A promptolási útmutató részletes információkat tartalmaz a hanggenerálás helyes használatához.
Telepítés és futtatás
A modell futtatásához a huggingface_hubról kell letölteni a szükséges fájlokat, majd a mlx-vlm paranccsal indítható el a szkript, amely a megadott prompt alapján hozza létre a videót. A modell helyi futtatása jelentős számítási kapacitást igényel, de lehetőséget teremt a fejlesztők számára, hogy Apple-hardveren futtassanak nagy méretű multimodális AI-alkalmazásokat.
A MiniMaxAI bemutatta a MiniMax-H3 modellt, amely egy általános célú, omni-modális generatív rendszer. Ez a gyakorlatban azt jelenti, hogy szöveget, képeket, hangot és videót képes bemenetként elfogadni, és ezekből akár 15 másodperces videoklipeket is létrehozni, hanggal együtt.