ÉlőUtoljára: 20 perceMa: 15
Kutatásfrissítve: 09:16

Új tesztet alkotott a Stanford és a Google, hogy az AI lekérdezhesse az épületek adatait

A Stanford és a Google Robotics kutatói által fejlesztett Build2SPARQL teljesítményteszt 6136 SPARQL lekérdezést és 30680 természetes nyelvű kérdést tartalmaz, amelyek épületautomatizálási tudásgráfók lekérdezésére szolgálnak.

Új tesztet alkotott a Stanford és a Google, hogy az AI lekérdezhesse az épületek adatait
Fotó: Logan Gutierrez / Unsplash
forrás: ArXiv AI·AI Forradalom szerk.·
Megosztás

Az épületautomatizálási rendszerek egyre inkább szemantikus tudásgráfokként (KG) jelennek meg, olyan ontológiákat használva, mint a Brick és az ASHRAE 223P. Ez egy géppel olvasható alapot teremt a mesterséges intelligencia alkalmazások számára. Az egyik ígéretes alkalmazás a természetes nyelvű kérdések SPARQL-re (szövegből-SPARQL) történő fordítása, amely lehetővé tenné az épületüzemeltetők számára, hogy nyelvi ügynökökön keresztül lekérdezzék ezeket a gráfokat. Azonban a nagyméretű, természetes nyelvű/SPARQL teljesítménytesztek hiánya korlátozza az előrehaladást. (ArXiv AI)

A Build2SPARQL teljesítményteszt részletei

Ez a cikk bemutatja a Build2SPARQL-t, egy nagyméretű teljesítménytesztet épület KG-k számára. A rendszert egy KG-alapú folyamat generálja: az SPARQL lekérdezéseket teljes mértékben grafikon-bejáró kód validálja, míg a nagy nyelvi modellek (LLM) csak a természetes nyelvű kérdéseket hozzák létre, így a lekérdezések helyessége független a modell viselkedésétől. A folyamat hat lekérdezési mintázatot (lineáris láncok, elágazások, UNION, aggregáció, OPTIONAL és attribútum-szűrt) tár fel, és minden lekérdezést öt különböző szókincs-regiszterben fogalmaz meg.

Eredmények és validáció

A 201 épület KG-ra (180 Brick, 21 ASHRAE 223P) alkalmazva a rendszer 6136 végrehajtható SPARQL lekérdezést és 30680 kérdést eredményez. A 300 kérdésre kiterjedő, két értékelő által végzett emberi validáció 98,8%-os szemantikai hűséget, 98,8%-os természetességet és 84,0%-os működési plausibilitást talált. A visszakereséssel kiegészített értékelés három nyílt súlyú nyelvi modell esetében a pontos egyezés pontosságát 0,2–20%-ról (zero-shot) 56–65%-ra (three-shot retrieved) növelte.

Jelentőség és korlátok

A Build2SPARQL teljesítményteszt jelentős előrelépést tesz lehetővé az épületautomatizálási AI-alkalmazások, például a nyelvi ügynökök fejlesztésében. A kutatók szerint az eredmények általánosíthatósága más modellekre korlátozott lehet, mivel csak három nyílt súlyú modellt teszteltek. A működési plausibilitás 84,0%-os értéke egy kis, ember által validált almintán alapul, és nagyobb mintákon eltérhet.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom