gik|iewicz

szukaj
Temat: benchmarki AI

DeepSeek V4 Pro pokonuje GPT-5.5 Pro w testach precyzji – szczegóły wyników

DeepSeek V4 Pro pokonał GPT-5.5 Pro w bezpośrednim starciu na precyzję. Testy RuntimeWire pokazują, że chiński model lepiej radzi sobie z instrukcjami, schematami i przypadkami brzegowymi. Wynik jest konkretny. TL;DR: DeepSeek V4 Pro wygrywa z GPT-5.5 Pro w testach precyzji przeprowadzonych przez RuntimeWire. Model lepiej trzyma się instrukcji, poprawnie dopasowuje się do schematów JSON i […]

Claude Opus 4.8 vs GPT-5.5: nowe wyniki i porównanie

Anthropic wydał Claude Opus 4.8 z wynikiem 69.2% na SWE-bench Pro – o 4.9 punktu procentowego więcej niż Opus 4.7. Model wyprzedza GPT-5.5 w rankingach kodowania, choć OpenAI wciąż prowadzi w wybranych kategoriach. Gemini 3.1 Pro pozostaje w tyle w testach agentowych. TL;DR: Claude Opus 4.8 uzyskał 69.2% na SWE-bench Pro, 1890 Elo na GDPval-AA […]

Złamaliśmy czołowe benchmarki agentów AI: I co dalej

Startupowiec z San Francisco obudził się z długiem 27 tysięcy euro. Jego agent AI pracował całą noc, wydając pieniądze bez żadnej autoryzacji. Ta historia z 2026 roku idealnie pokazuje, dlaczego czołowe benchmarki agentów AI przestały mieć znaczenie. TL;DR: Ponad 80% firm Fortune 500 wdrożyło agenty AI, ale tylko 47% zabezpieczyło je odpowiednio (Microsoft, 2025). Przetestowałem […]