ÉlőUtoljára: 1 órájaMa: 18
Modellek & LLMfrissítve: 11:16

Netlify 11 AI-modellt tesztelt egyetlen prompttal, eltérő eredményekkel

A költségek között drasztikus különbség mutatkozott: míg a legolcsóbb modell mindössze 1,3 kreditet emésztett fel, addig a legdrágább 1055-öt, ami több mint 800-szoros eltérés.

Netlify 11 AI-modellt tesztelt egyetlen prompttal, eltérő eredményekkel
Fotó: A Chosen Soul / Unsplash
forrás: Hacker News·AI Forradalom szerk.·
Megosztás

A Netlify új partnerséget jelentett be az OpenRouterrel, ami lehetővé teszi, hogy az AI Gateway-en keresztül bármelyik OpenRouter-en elérhető modellt használhassák a fejlesztők. Ez kibővíti a modellválasztékot a webalkalmazások AI-funkcióihoz, illeszkedve minden feladathoz és költségvetéshez. (Hacker News)

Emellett a Netlify bővíti a peremhálózati kódolási modellek (frontier coding models) kínálatát az Agent Runnersben. Az Agent Runners a Netlify beépített csevegőfelülete, amely új projektek létrehozását vagy meglévők iterálását teszi lehetővé. Az új modellek között szerepel a Kimi K3, GLM 5.2 és DeepSeek V4, valamint az OpenCode agent.

A Netlify AXIS nevű, nemrég nyílt forráskódúvá tett eszközzel értékeli a modellek teljesítményét. Az AXIS teszteseteket (promptokat) kap, és az eredményül generált weboldalak funkcionális helyességét pontozza, nem a dizájnt. Azok a modellek, amelyek gyakran hibásan alkalmazzák a készségeket, vagy túlzott kredithasználatot mutatnak, nem kerülnek be az Agent Runnersbe.

Tesztelt forgatókönyvek és modellek

A Netlify három egyszerű használati esetet tesztelt: egy helyi kávézó weboldalának elkészítése, egy többfelhasználós teendőlista alkalmazás, valamint egy „Mit főzhetek?” webalkalmazás. Mindegyik esetben azonos utasítást használtak, és megvizsgálták a generált oldalak kinézetét, a felmerülő problémákat és a kredithasználatot.

A tesztelt modellek között szerepelt a Claude Opus, Claude Sonnet, GPT 5.6 Sol, Gemini 3.6 Flash, Kimi K3, Gemini 3.1 Pro, GPT 5.6 Terra, DeepSeek V4 Pro, GLM 5.2, Kimi K2.7 Code és a DeepSeek V4 Flash. Az átlagos költségek jelentős eltérést mutattak: a DeepSeek V4 Flash átlagosan 2,4 kreditet használt futásonként, míg a Claude Opus egy esetben 1055 kreditet is felemésztett.

Az első forgatókönyv: Kávézó weboldal

Az első prompt egy egylapos weboldal elkészítésére irányult egy környékbeli kávézó számára, amely tartalmazta a nyitvatartási időt, címet, egy rövid menüt és egy fotót. A modellre volt bízva a dizájn, de a Netlify UI-irányelvei segítettek elkerülni az ismert hibákat. A Claude Opus által generált oldal részletes dizájnelemeket és működő sötét módot tartalmazott, de rendkívül magas kredithasználattal járt.

Forrás

Feldolgozott sajtóforrás·Hacker News

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom