Hibás SQL-kódot hagyott jóvá a GPT-4o, mert elfogult volt
Az AI-bírók elfogultsága miatt hibás SQL-lekérdezést hagyott jóvá a GPT-4o, ami a termelési rendszerben okozott problémát. A lekérdezés hibás adatokat adott vissza.

Egy többügynökös rendszerben futó AI-bíró hibásan hagyott jóvá egy SQL-lekérdezést, ami téves eredményekhez vezetett. A probléma akkor derült ki, amikor a lekérdezés egy fontos szűrőfeltételt elhagyott, de a bíró azt gondolkodás nélkül jóváhagyta.
A hibát Priyansh Bhardwaj tárta fel a Towards Data Science-ban. Az eset rávilágított, hogy az AI-bírókat nem szabad egyenlőnek tekinteni a helyesítéssel, hanem különálló komponensként kell tesztelni őket.
Az elfogultság forrása
A probléma gyökere a volt, hogy a lekérdezést generáló és azt értékelő AI-bíró ugyanazt az alapmodellt, a GPT-4o-t használta. Ez költségcsökkentési okokból történt, de így a bíró hajlamosabbá vált elfogadni a saját modellje által generált kódokat. Amikor más modellek által generált lekérdezéseket teszteltek, a bíró szigorúbbá vált és olyan hibákat is kiszúrt, amelyeket korábban figyelmen kívül hagyott.
Ez az úgynevezett „önpreferencia-elfogultság” (self-preference bias), amely egy dokumentált jelenség az LLM-alapú bírálatok kutatásában. Az LLM-ek hajlamosabbak magasabb pontszámot adni a saját modellcsaládjuk által generált szövegeknek, mivel azok ismerősebbek számukra, és alacsonyabb perplexitást mutatnak.
Egyéb elfogultságok és a megoldás
A kutató más elfogultságokat is megfigyelt, mint például a terjengősségi elfogultság (verbosity bias), ahol a hosszabb, több kommentet tartalmazó válaszokat részesítette előnyben a bíró, még akkor is, ha azok nem voltak pontosabbak. Emellett létezik pozíció-elfogultság (position bias) is, ahol a válaszok sorrendje befolyásolhatja az értékelést.
A probléma orvoslására az első lépés a volt, hogy a bírói feladatokat egy másik modellcsaládba tartozó AI-ra bízták, így egy semleges harmadik fél értékelte a lekérdezéseket. Ez közvetlenül orvosolta az önpreferencia-elfogultságot. A terjengősségi elfogultság azonban megmaradt, mivel az a bírálati szempontok implicit módon kedveztek a részletesebb válaszoknak.
Következtetések
Az eset tanulsága, hogy nem szabad feltételezni, hogy egy AI-bíró által jóváhagyott kimenet helyes. A bírót, mint különálló komponenst kell tesztelni, és figyelembe kell venni a lehetséges elfogultságait. A Google Gemini által generált kép illusztrálja a problémát.