Világelső dupla vak AI-értékelést indít a Google a Gemini Lite-tal
A Google a szingapúri AI Safety Institute, az OpenMined, az AVERI és a MLCommons partnerekkel kriptográfiailag biztonságos környezetben teszteli a Gemini Flash Lite modellt, hogy megakadályozza a teljesítményteszt-szennyeződést.

A Google augusztus 27-én bejelentette, hogy elindította a világ első kettős vak értékelését egy saját fejlesztésű, csúcskategóriás AI-modell, a Gemini Flash Lite esetében. A cél az értékelési integritás növelése és a teljesítményteszt-szennyeződés megelőzése, ami akkor következik be, ha egy modell már a tesztelés előtt látja a kérdéseket. (Google DeepMind)
A kettős vak értékelés során a Google Cloud Confidential Space technológiáját használják, amely kriptográfiailag biztosítja, hogy sem a tesztelő fél nem láthatja a modell súlyait, sem a Google nem láthatja a tesztelők által használt promptokat. Ez egy új megközelítés a modellértékelésekben, amely védi az intellektuális tulajdont és az adatok szuverenitását.
Kettős vak értékelés a bizalomért
A hagyományos külső értékeléseknél kompromisszumot kellett kötni: vagy a tesztelő adta át a promptokat a modellfejlesztőnek, vagy a modell súlyait a tesztelőnek. A kettős vak módszer ezt a dilemmát hárítja el. A Google a szingapúri AI Safety Institute, az OpenMined, az AVERI és a MLCommons intézetekkel működik együtt a Gemini Flash Lite modell tesztelésében, bizalmas teljesítménytesztek ellenében.
Biztonságos környezet a fejlesztőknek
A kriptográfiai bizonyítékok segítenek megelőzni a teljesítményteszt-szennyeződést és védik az érzékeny adatokat. Ez különösen fontos a kiberbiztonsági vagy kormányzati szervek által végzett értékeléseknél. A kettős vak értékelések lehetővé teszik független szervezetek számára, hogy szigorúan teszteljék a fejlett modelleket anélkül, hogy adatvédelmi vagy biztonsági aggályok merülnének fel. A Google reményei szerint ez a pilotprogram új mérföldkövet jelent a modellfelügyelet terén, és hozzájárul a biztonságosabb, megbízhatóbb és szélesebb körben elfogadott AI-rendszerek kiépítéséhez.