11/06/2026
🚨 Wielkie rozczarowanie w świecie AI? Nowy test pokazuje surową rzeczywistość 📉
Badacze z UC Berkeley (RDI) uruchomili właśnie Agents’ Last Exam (ALE) – najtrudniejszy dotąd benchmark, mający sprawdzić, czy sztuczna inteligencja potrafi naprawdę wykonywać złożone, profesjonalne zadania w środowisku pracy, a nie tylko rozwiązywać proste łamigłówki.
Wyniki są szokujące: 🥇 GPT-5.5 (przez Codex) zajął pierwsze miejsce, ale... 📉 Sukces to tylko 24% zdawalności!
Nawet najnowszy model od Anthropic, Claude Fable 5, zajął dopiero 3. miejsce (22%), a starsze modele (jak Claude Opus 4.8) na najtrudniejszym poziomie uzyskały 0,0% zdawalności. ❌
Dlaczego tak źle? Nowy test nie pozwala na "oszukiwanie" ani na pamięciowe odtwarzanie odpowiedzi. AI musi: 👀 Widzieć i nawigować po systemie (Windows/Linux). 🖱️ Używać myszki i klawiatury w prawdziwych programach (np. Adobe After Effects, Siemens NX). 🛠️ Wykonywać długie, wieloetapowe procesy w 55 różnych branżach.
To cios w marketingowe obietnice. Nawet najpotężniejsze modele wciąż mają ogromną przepaść między "być może" a "gotowe do pracy". ALE ma być kompasem, który pokaże, kiedy AI będzie naprawdę gotowe do dołączenia do siły roboczej.
Czy uważasz, że AI jest już na tyle gotowe, by zastąpić ludzi w złożonych zadaniach, czy jeszcze daleko jej do celu? 👇