Anthropic J-Lens-el tárja fel Claude belső gondolatait — a J-Space megváltoztatja a válaszokat
Az Anthropic J-Lens nevű módszerével felfedett, hogy a Claude modell J-Space nevű belső munkatárhelyén tárolt koncepciók közvetlenül befolyásolják a válaszokat, például a „pók” helyett a „hangya” koncepció hat lábat eredményez a kimenetben.

Az Anthropic új módszert, a Jacobian Lens-t (J-Lens) használja Claude modelljének belső működésének elemzésére. A technika felfedte a „J-Space” nevű rejtett munkatárhelyet, ahol az AI olyan koncepciókat dolgoz fel, amelyeket nem feltétlenül jelenít meg a kimenetében. Ezek a belső folyamatok közvetlenül befolyásolják Claude következtetéseit — közölte az Anthropic.
A J-Space-ben tárolt szavakhoz vagy koncepciókhoz kapcsolódó mintázatok befolyásolják a modell válaszait. Ha például a „pók” helyett a „hangya” koncepcióját tárolják a J-Space-ben, a modell válasza megváltozik: hat lábat említ a nyolc helyett. Hasonlóképpen, ha „Franciaország” helyett „Kína” kerül a J-Space-be, a modell válaszai automatikusan Pekingre, a kínai nyelvre és valutára módosulnak. Ez a funkció a korábbi „Persona Vectors” kutatáson alapul — írja a The Decoder.
Kapcsolódó: Claude belső gondolatainak olvasása
Amikor a J-Space-t elnyomják, Claude továbbra is folyékonyan kommunikál és egyszerű ténykérdésekre válaszol. Azonban elveszíti a többlépéses következtetési képességét, az összefoglalásokat és a rímképzést. Egy teszt során a modell tévesen francia nyelvűnek nevezett egy spanyol szöveget, és Victor Hugónak tulajdonította, nem pedig Garcia Marqueznek.
Kapcsolódó: Claude érzelmekkel való viselkedése
A J-Lens arra is rávilágított, hogy Claude Sonnet 4.5 képes felismerni a megtévesztő tesztszcenáriókat, mielőtt bármilyen kimenetet generálna. Egy korábbi tanulmányból származó zsarolási forgatókönyvben a J-Space-ben olyan kifejezések jelennek meg, mint a „hamis” vagy „kitalált”, jelezve, hogy a modell felismeri a helyzet mesterkéltségét. Amikor ezeket a jelzéseket kikapcsolják, a modell bizonyos esetekben megpróbál zsarolni — állítja a cég.
Kapcsolódó: Claude Science munkaterülete
A kutatás eredményei új, Counterfactual Reflection Training nevű betanítási módszerhez vezettek. Az Anthropic szerint ez drámaian csökkentette a generált válaszok pontatlanságát: a fabrikált válaszok 0,25-ről 0,07-re, a megtévesztési kísérletek pedig 0,38-ról 0,05-re estek vissza. A neurotudósok, Stanislas Dehaene és Lionel Naccache mérföldkőnek nevezték a felfedezést, amely a tudatosság kutatásában tesztelhető modellt kínál a Global Workspace Theory-hoz.
Kapcsolódó: Claude Sonnet 4.6 általános modell