Az ingatlanfotókat automatikusan besorolja a fejlesztett AI az Alma Media-nál
A finomhangolás nem mindig a legjobb megoldás, de az Alma Media ingatlanfotó-besorolási problémáit megoldotta. Három kérdés segít a döntésben.

Az Alma Media ingatlanhirdetési szolgáltatásai több százezer listát kezelnek évente, melyekhez gyakran több tucat fotó tartozik, de nincs információ arról, mit ábrázolnak. A keresést, ajánlásokat és belső használatot is segíti, ha tudjuk, hogy egy fotó konyhát, alaprajzot vagy kertet mutat. Erre a célra automatikus képbesorolási rendszert fejlesztettek. (Towards Data Science)
A rendszer 23 kategóriát azonosít, beleértve olyan helyiségtípusokat, mint a nappali, konyha vagy hálószoba, valamint olyan elemeket, mint az alaprajzok, tetőtéri fotók és marketinganyagok. A feladat klasszikus többcímkés besorolás, ahol egy kép több kategóriába is eshet. A döntéshozatalban fontos a besorolási magabiztosság, ami azonban a harmadik féltől származó API-k esetén nehezen hozzáférhető.
Döntési szempontok az API és a saját modell között
A cég saját, proprietáris besorolóit a google/siglip-base-patch16-224 modell finomhangolásával hozta létre. A döntés, hogy érdemes-e saját modellt fejleszteni, három kulcsfontosságú kérdésre vezethető vissza. Először is, promptolható-e az API, vagy saját modellt kell-e trainelni. Másodszor, a feladat alkalmas-e promptolásra. Harmadszor, mérlegelni kell az API és a saját fejlesztésű besorolók közötti előnyöket és hátrányokat.
A harmadik féltől származó API-k használata egyszerűbb lehet, különösen új termékek bevezetésekor, mivel nem igényelnek előzetes annotált adathalmazt. Azonban nagy volumenek esetén a költségek drasztikusan eltérhetnek: míg egymillió kép API-s feldolgozása nagyjából 1500 dollárba kerülhet, saját GPU-s megoldással ez akár 0,37 dollárra is csökkenhet. Az API-k esetében a megbízható konfidencia-becslések kinyerése is nehézkes lehet.
Modellválasztás és licencelés
Ha saját modellt trainelnek, érdemes nyílt forráskódú, előre betanított modellekkel, például a Google SigLIP vagy a Meta DINO vizuális transzformerjeivel kezdeni. Fontos ellenőrizni a modell licencét kereskedelmi használatra, és figyelembe venni a modell előképzési stratégiáját. A SigLIP például feliratozott képeken lett trainelve, így jobban összpontosít a feliratozható dolgokra, míg a DINO patch-szintű célokkal dolgozik.
Miikka Silfverberg, Max Silfverberg, Antti Hallavo és Pontus Huotari szerint a LoRA finomhangolás sikeresen megoldotta az Alma Media képbesorolási problémáit. A 23 kategóriás feladatukban a saját modell trainelése bizonyult a költséghatékonyabb és rugalmasabb megoldásnak.