
Az AI-vége 1-4 év múlva érkezhet, éljük meg az utolsó éveket vidáman
NickyP, a LessWrong AI szerző szerint az emberiségnek mindössze 1-4 éve maradt, mielőtt az AI radikálisan átalakítja a világot.
AI research papers, arXiv publikációk, benchmarkok, tudományos áttörések

NickyP, a LessWrong AI szerző szerint az emberiségnek mindössze 1-4 éve maradt, mielőtt az AI radikálisan átalakítja a világot.

A modell 94–96%-os pontossággal azonosítja az ismert fajokat, de ismeretlen gombáknál tévesen osztályoz — ami mérgezési kockázatot jelent.

Lorca McLaren és munkatársai hat modellt teszteltek, és megállapították, hogy a folyamat választások kölcsönhatásai meghatározzák az eredményeket.

A Claude Opus 4.5 modell a FormalProofBench tesztjén 33,5%-os pontosságot ért el, amely a diplomamunka-szintű, Lean 4-alapú matematikai bizonyítások ellenőrzésére szolgál.

A kutatók szerint a modell teljesítménye az érzelem típusától és a kulturális kontextustól függ.

A DeepMind Safety Research csapata kidolgozott egy keretrendszert, amely segít előrejelezni, hogy az RL-képzés mikor rontja a Chain-of-Thought monitorozhatóságát.

A kutatók 516 egyedi bizonyítási állapottal vizsgálták, hogyan hat a visszajelzések ellenőrzése a nagy nyelvi modellek logikai bizonyítási teljesítményére, és felfedezték, hogy az ellenőrzés csak hibás visszajelzés esetén javít, míg pontos visszajelzésnél akár ront is.

2024 októberben alakult LIMBO kutatócsoport már az első évben 5,6 millió dollárba kerülő, exportkontroll alá eső hardveren futó modelljével bizonyította, hogy a ritka események becslése matematikailag kezelhető, és még pénzügyi piacokon is nyereséget hozott.

Több kutatás is azt találta, hogy az LLM-ek által generált magyarázatok nem pontosak, és a szakértők szerint ez komoly probléma az AI-felelősség szempontjából.

A WildChat platformon gyűjtött, 2 500 interakcióból álló AlpsBench teszt valós ember-LLM párbeszédeken alapul, és négy feladat – információk kinyerése, frissítése, visszakeresése, felhasználása – mentén értékeli a memória teljes életciklusát.

A Mistral AI szerint a testreszabás logikájának leválasztása az alapmodellről biztosítja, hogy a vállalatok "digitális idegrendszere" rugalmas maradjon.

A kutatók szerint az LLM újraparaméterezése akár 10%-kal is javíthatja a teljesítményt, ha a modellhez nagy mennyiségű, minőségi adatot biztosítanak.

A TurboQuant.net elemzés szerint a kompresszióhatárok eléréséhez közelednek, és az új fejlesztések valószínűleg más irányból érkeznek.

Az arXiv-on közzétett felmérés több mint száz kutatási eredményt elemezve három bizonytalanság-mérési módszert (Bayes-alapú, Monte Carlo, konformális) és három integrációs stratégiát (megbízhatóság, korlátozás, nyílt kommunikáció) azonosít az UAXAI rendszerekben, kiemelve a kalibráció és az eloszlásfüggetlen technikák növekvő szerepét.

A PentaNet projekt mögött álló csapat 124M paramétert használ az új modellben.

A LocalLLaMA közösség szerint a Linuxon futó inference akár 30%-kal gyorsabb lehet, mint a Windows alatt.

Gina Chua újságíró-stratéga két napot töltött Claude-dal szerkesztői folyamat tesztelésére — és nyíltan szólt arról, amit talált: az LLM-ek nem értenek semmit, csak analógiák alapján utánoznak.

A ccunpacked.dev oldal részletesen feltárta a Claude Code belső architektúráját: az alkalmazás egy 11 lépéses agent loopon alapul, amelybe a felhasználói bemenet feldolgozásától az API-válaszig minden lépés beágyazódik.

A Google TurboQuant módszere csak egydimenziós vektorokon forgatja a súlyokat — a 2D súlymátrixokon ez nem működik, ezért a kvantáláshoz más megközelítés kell.

Hat modellt teszteltek, és mindegyiknél ugyanazt találták: a felületi jelek 8–38-szor erősebben befolyásolják a döntést, mint maga a feladat célja.

A SciVisAgentBench tesztet Kuangshi Ai és 15 kollégája hozta létre, 108 szakértői esetet tartalmazva, és 12 SciVis szakértővel közösen fejlesztették ki, hogy több lépéses, valós elemzési környezetben mérje a tudományos adatelemzés és visualizáció teljesítményét.
Tetszik az oldal? Támogasd a fejlesztést
Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.