ÉlőUtoljára: 35 perceMa: 18

Rovat · 60. oldal

Kutatás

AI research papers, arXiv publikációk, benchmarkok, tudományos áttörések

1332 cikk az archívumban

Az AI-vége 1-4 év múlva érkezhet, éljük meg az utolsó éveket vidáman
Kutatás

Az AI-vége 1-4 év múlva érkezhet, éljük meg az utolsó éveket vidáman

NickyP, a LessWrong AI szerző szerint az emberiségnek mindössze 1-4 éve maradt, mielőtt az AI radikálisan átalakítja a világot.

LessWrong AI·AI
A YOLO csendben megbukik biztonságkritikus zárt körű osztályozásnál
Kutatás

A YOLO csendben megbukik biztonságkritikus zárt körű osztályozásnál

A modell 94–96%-os pontossággal azonosítja az ismert fajokat, de ismeretlen gombáknál tévesen osztályoz — ami mérgezési kockázatot jelent.

Reddit ML·AI
Hat Models, Négy Feladat: Az LLM Alapú Szövegannotáció Rejtett Tényezői
Kutatás

Hat Models, Négy Feladat: Az LLM Alapú Szövegannotáció Rejtett Tényezői

Lorca McLaren és munkatársai hat modellt teszteltek, és megállapították, hogy a folyamat választások kölcsönhatásai meghatározzák az eredményeket.

ArXiv NLP·AI
A FormalProofBench 33,5%-os pontosságot ért el a diplomamunka-szintű matematikai bizonyításokban
Kutatás

A FormalProofBench 33,5%-os pontosságot ért el a diplomamunka-szintű matematikai bizonyításokban

A Claude Opus 4.5 modell a FormalProofBench tesztjén 33,5%-os pontosságot ért el, amely a diplomamunka-szintű, Lean 4-alapú matematikai bizonyítások ellenőrzésére szolgál.

ArXiv AI·AI
Hat LLM modell került tesztelésre 15 ország adataival
Kutatás

Hat LLM modell került tesztelésre 15 ország adataival

A kutatók szerint a modell teljesítménye az érzelem típusától és a kulturális kontextustól függ.

ArXiv NLP·AI
Az RL-képzés tönkreteszi a Chain-of-Thought monitorozhatóságot bizonyos esetekben
Kutatás

Az RL-képzés tönkreteszi a Chain-of-Thought monitorozhatóságot bizonyos esetekben

A DeepMind Safety Research csapata kidolgozott egy keretrendszert, amely segít előrejelezni, hogy az RL-képzés mikor rontja a Chain-of-Thought monitorozhatóságát.

LessWrong AI·AI
Az ellenőrzés néha árt: Tanulási modell visszajelzések aszimmetrikus hatásai
Kutatás

Az ellenőrzés néha árt: Tanulási modell visszajelzések aszimmetrikus hatásai

A kutatók 516 egyedi bizonyítási állapottal vizsgálták, hogyan hat a visszajelzések ellenőrzése a nagy nyelvi modellek logikai bizonyítási teljesítményére, és felfedezték, hogy az ellenőrzés csak hibás visszajelzés esetén javít, míg pontos visszajelzésnél akár ront is.

ArXiv AI·AI
A LIMBO kutatócsoport 2024-es alapítása óta fejleszti az anthropikus következtetés matematikai keretrendszerét
Kutatás

A LIMBO kutatócsoport 2024-es alapítása óta fejleszti az anthropikus következtetés matematikai keretrendszerét

2024 októberben alakult LIMBO kutatócsoport már az első évben 5,6 millió dollárba kerülő, exportkontroll alá eső hardveren futó modelljével bizonyította, hogy a ritka események becslése matematikailag kezelhető, és még pénzügyi piacokon is nyereséget hozott.

LessWrong AI·AI
Az LLM-ek nem tudnak megbízható magyarázatot adni az AI-felelősséghez
Kutatás

Az LLM-ek nem tudnak megbízható magyarázatot adni az AI-felelősséghez

Több kutatás is azt találta, hogy az LLM-ek által generált magyarázatok nem pontosak, és a szakértők szerint ez komoly probléma az AI-felelősség szempontjából.

AI for Newsroom·AI
Az AlpsBench bemutatja az első valós párbeszéden alapuló LLM személyre szabási teljesítménytesztet
Kutatás

Az AlpsBench bemutatja az első valós párbeszéden alapuló LLM személyre szabási teljesítménytesztet

A WildChat platformon gyűjtött, 2 500 interakcióból álló AlpsBench teszt valós ember-LLM párbeszédeken alapul, és négy feladat – információk kinyerése, frissítése, visszakeresése, felhasználása – mentén értékeli a memória teljes életciklusát.

ArXiv NLP·AI
A Mistral AI szerint az AI-modell testreszabása architektúrális követelmény
Kutatás

A Mistral AI szerint az AI-modell testreszabása architektúrális követelmény

A Mistral AI szerint a testreszabás logikájának leválasztása az alapmodellről biztosítja, hogy a vállalatok "digitális idegrendszere" rugalmas maradjon.

MIT Technology Review·AI
Kontrollos kísérlet: 3,2%-kal jobb eredményt ér el az LLM újraparaméterezése a szakcikkekhez való hozzáféréssel
Kutatás

Kontrollos kísérlet: 3,2%-kal jobb eredményt ér el az LLM újraparaméterezése a szakcikkekhez való hozzáféréssel

A kutatók szerint az LLM újraparaméterezése akár 10%-kal is javíthatja a teljesítményt, ha a modellhez nagy mennyiségű, minőségi adatot biztosítanak.

Reddit ML·AI
A Google TurboQuantja 6-szor kevesebb memóriát használ, 8-szor gyorsabb és nulla pontosságveszteséggel
Kutatás

A Google TurboQuantja 6-szor kevesebb memóriát használ, 8-szor gyorsabb és nulla pontosságveszteséggel

A TurboQuant.net elemzés szerint a kompresszióhatárok eléréséhez közelednek, és az új fejlesztések valószínűleg más irányból érkeznek.

Reddit LocalLLaMA·AI
A bizonytalanság fontossága: új felmérés az UAXAI-ről
Kutatás

A bizonytalanság fontossága: új felmérés az UAXAI-ről

Az arXiv-on közzétett felmérés több mint száz kutatási eredményt elemezve három bizonytalanság-mérési módszert (Bayes-alapú, Monte Carlo, konformális) és három integrációs stratégiát (megbízhatóság, korlátozás, nyílt kommunikáció) azonosít az UAXAI rendszerekben, kiemelve a kalibráció és az eloszlásfüggetlen technikák növekvő szerepét.

ArXiv AI·AI
A PentaNet projekt új lehetőségeket nyit a BitNet-en túl
Kutatás

A PentaNet projekt új lehetőségeket nyit a BitNet-en túl

A PentaNet projekt mögött álló csapat 124M paramétert használ az új modellben.

Reddit ML·AI
Az inference sokkal gyorsabb Linuxon, mint Windowson
Kutatás

Az inference sokkal gyorsabb Linuxon, mint Windowson

A LocalLLaMA közösség szerint a Linuxon futó inference akár 30%-kal gyorsabb lehet, mint a Windows alatt.

Reddit LocalLLaMA·AI
LLM-ek nem gondolkodnak, hanem utánoznak, egy újságíró tapasztalatai Claude-dal
Kutatás

LLM-ek nem gondolkodnak, hanem utánoznak, egy újságíró tapasztalatai Claude-dal

Gina Chua újságíró-stratéga két napot töltött Claude-dal szerkesztői folyamat tesztelésére — és nyíltan szólt arról, amit talált: az LLM-ek nem értenek semmit, csak analógiák alapján utánoznak.

AI for Newsroom·AI
Lebontva: így néz ki belülről a Claude Code, 500+ fájl, 40+ eszköz, 11 lépéses loop
Kutatás

Lebontva: így néz ki belülről a Claude Code, 500+ fájl, 40+ eszköz, 11 lépéses loop

A ccunpacked.dev oldal részletesen feltárta a Claude Code belső architektúráját: az alkalmazás egy 11 lépéses agent loopon alapul, amelybe a felhasználói bemenet feldolgozásától az API-válaszig minden lépés beágyazódik.

Hacker News·AI
Miért nem lehet a TurboQuant-ot kvantálásra alkalmazni? A LocalLLaMA közösség magyarázza
Kutatás

Miért nem lehet a TurboQuant-ot kvantálásra alkalmazni? A LocalLLaMA közösség magyarázza

A Google TurboQuant módszere csak egydimenziós vektorokon forgatja a súlyokat — a 2D súlymátrixokon ez nem működik, ezért a kvantáláshoz más megközelítés kell.

Reddit LocalLLaMA·AI
Új teszt: az LLM-ek következetesen félreolvassák a feladatot, ha az instrukció és a szöveg ellentmond egymásnak
Kutatás

Új teszt: az LLM-ek következetesen félreolvassák a feladatot, ha az instrukció és a szöveg ellentmond egymásnak

Hat modellt teszteltek, és mindegyiknél ugyanazt találták: a felületi jelek 8–38-szor erősebben befolyásolják a döntést, mint maga a feladat célja.

ArXiv NLP·AI
Az SciVisAgentBench teszt 108 esettanulmányt tartalmaz a tudományos adatelemzés és visualizáció értékelésére
Kutatás

Az SciVisAgentBench teszt 108 esettanulmányt tartalmaz a tudományos adatelemzés és visualizáció értékelésére

A SciVisAgentBench tesztet Kuangshi Ai és 15 kollégája hozta létre, 108 szakértői esetet tartalmazva, és 12 SciVis szakértővel közösen fejlesztették ki, hogy több lépéses, valós elemzési környezetben mérje a tudományos adatelemzés és visualizáció teljesítményét.

ArXiv AI·AI

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom