Új tesztet alkotott a Stanford és a Google, hogy az AI lekérdezhesse az épületek adatait
A Stanford és a Google Robotics kutatói által fejlesztett Build2SPARQL teljesítményteszt 6136 SPARQL lekérdezést és 30680 természetes nyelvű kérdést tartalmaz, amelyek épületautomatizálási tudásgráfók lekérdezésére szolgálnak.

Az épületautomatizálási rendszerek egyre inkább szemantikus tudásgráfokként (KG) jelennek meg, olyan ontológiákat használva, mint a Brick és az ASHRAE 223P. Ez egy géppel olvasható alapot teremt a mesterséges intelligencia alkalmazások számára. Az egyik ígéretes alkalmazás a természetes nyelvű kérdések SPARQL-re (szövegből-SPARQL) történő fordítása, amely lehetővé tenné az épületüzemeltetők számára, hogy nyelvi ügynökökön keresztül lekérdezzék ezeket a gráfokat. Azonban a nagyméretű, természetes nyelvű/SPARQL teljesítménytesztek hiánya korlátozza az előrehaladást. (ArXiv AI)
A Build2SPARQL teljesítményteszt részletei
Ez a cikk bemutatja a Build2SPARQL-t, egy nagyméretű teljesítménytesztet épület KG-k számára. A rendszert egy KG-alapú folyamat generálja: az SPARQL lekérdezéseket teljes mértékben grafikon-bejáró kód validálja, míg a nagy nyelvi modellek (LLM) csak a természetes nyelvű kérdéseket hozzák létre, így a lekérdezések helyessége független a modell viselkedésétől. A folyamat hat lekérdezési mintázatot (lineáris láncok, elágazások, UNION, aggregáció, OPTIONAL és attribútum-szűrt) tár fel, és minden lekérdezést öt különböző szókincs-regiszterben fogalmaz meg.
Eredmények és validáció
A 201 épület KG-ra (180 Brick, 21 ASHRAE 223P) alkalmazva a rendszer 6136 végrehajtható SPARQL lekérdezést és 30680 kérdést eredményez. A 300 kérdésre kiterjedő, két értékelő által végzett emberi validáció 98,8%-os szemantikai hűséget, 98,8%-os természetességet és 84,0%-os működési plausibilitást talált. A visszakereséssel kiegészített értékelés három nyílt súlyú nyelvi modell esetében a pontos egyezés pontosságát 0,2–20%-ról (zero-shot) 56–65%-ra (three-shot retrieved) növelte.
Jelentőség és korlátok
A Build2SPARQL teljesítményteszt jelentős előrelépést tesz lehetővé az épületautomatizálási AI-alkalmazások, például a nyelvi ügynökök fejlesztésében. A kutatók szerint az eredmények általánosíthatósága más modellekre korlátozott lehet, mivel csak három nyílt súlyú modellt teszteltek. A működési plausibilitás 84,0%-os értéke egy kis, ember által validált almintán alapul, és nagyobb mintákon eltérhet.