Microsoft ThinkingBox sprawdza agentów AI 20 razy. Claude Opus 5.5 zalicza bez błędu mniej niż połowę zadań
Microsoft sprawdził, czy agenci AI naprawdę kończą zadania w systemach firmy, i każde z 507 zadań powtórzył 20 razy. Najlepsze modele wykonały bez błędu za każdym razem mniej niż połowę zadań, a większość porażek kończyła się bez żadnego sygnału błędu.

Microsoft opublikował 3 października na blogu Hugging Face test ThinkingBox, który sprawdza agentów AI po tym, co zostawili w bazie danych, a nie po tym, co napisali. Każde z 507 zadań biznesowych badacze puścili 20 razy na kilkunastu modelach. Wynik dotyczy każdej firmy, która daje agentowi dostęp do zamówień, zgłoszeń albo kont klientów. Opis i pełne tabele są we wpisie Microsoftu i Hugging Face o ThinkingBox.
Agent mówi „załatwione”, baza mówi co innego
Autorzy zaczynają od przykładu. Klientka pyta o sprzęt kuchenny za 745 dolarów, który od 15 dni utknął u kuriera. Agent wykonuje dziewięć poprawnych kroków: sprawdza zamówienie, śledzenie przesyłki i regulamin, zakłada zgłoszenie. Potem zamyka je jako rozwiązane i pyta, czy może pomóc w czymś jeszcze. Problem z przesyłką wciąż jest otwarty, więc zgłoszenie powinno czekać, a klientka nie dostała odpowiedzi na swoje pytanie.
Ocena oparta na samych wywołaniach narzędzi uznałaby tę pracę za dobrą. ThinkingBox patrzy na stan bazy po zakończeniu zadania i na skutki uboczne. Na dużej próbie widać skalę zjawiska: w 121 680 próbach 12 modeli nieudanych było 79 853. Dwie trzecie z nich (67 proc.) skończyło się pozornie czysto: agent coś w systemie zmienił i nie zgłosił żadnego błędu.
Raz się udało to za mało
Druga miara to powtarzalność. Model, który raz poprawnie odda pieniądze klientowi, a cztery kolejne razy pomyli się, nie nadaje się do zwrotów. Dlatego autorzy liczą, ile zadań model wykonał poprawnie we wszystkich 20 podejściach.
| Model | Średni wynik jednego podejścia | Zadania zaliczone 20 na 20 (z 507) |
|---|---|---|
| Claude Opus 5.5 | 67,16 proc. | 241 |
| Claude Opus 5 | 66,50 proc. | 241 |
| GPT-5.4 | 65,36 proc. | 128 |
| GPT-6 Astra | 58,31 proc. | 231 |
| Kimi K3 | 57,37 proc. | 68 |
Kimi K3 to przypadek, który najlepiej pokazuje sens tej miary. Model rozwiązał przynajmniej raz 476 z 507 zadań, najwięcej w teście. Bez pomyłki we wszystkich próbach przeszedł jednak tylko 68. Claude Opus 5.5 wypadł w średniej lepiej niż Opus 5, ale zaliczył dokładnie tyle samo zadań 20 na 20.
Ważna jest też branża. W zadaniach ze sprzedaży detalicznej modele miały średnio 59,52 proc., w ubezpieczeniach komunikacyjnych 33,83 proc.
Ile kosztuje agent, na którym można polegać
Autorzy policzyli koszt całej serii 20 przebiegów według cenników z OpenRouter i podzielili go przez liczbę zadań zaliczonych za każdym razem. Zastrzegają, że to wskaźnik do porównań, a nie rachunek z chmury. Przeliczyliśmy go po kursie NBP z 2 października (tabela 192/A/NBP/2026, 3,8881 zł za dolara).
| Model | Koszt na zadanie zaliczone 20 na 20 | W złotych |
|---|---|---|
| GPT-5.4 | 6,80 dolara | ok. 26,44 zł |
| GPT-6 Astra | 7,45 dolara | ok. 28,97 zł |
| Claude Opus 5.5 | 7,80 dolara | ok. 30,33 zł |
| Claude Opus 5 | 13,30 dolara | ok. 51,71 zł |
Ceny modeli w złotych zbieramy w cenniku modeli.
Co z tego wynika dla firmy
Według autorów cztery na pięć porażek (79,9 proc.) to problemy z obsługą narzędzi, a nie z rozumowaniem. Agent dochodzi do właściwego miejsca, ale nie radzi sobie z błędem narzędzia, pustym wynikiem wyszukiwania albo niespełnionym warunkiem. Jeśli wdrażasz agenta, autorzy radzą sprawdzać stan systemu przed zatwierdzeniem zmiany, a nie wierzyć podsumowaniu agenta. Do tego ograniczyć liczbę narzędzi do potrzebnych i wymagać zgody człowieka przy zmianach, których nie da się łatwo cofnąć. Sami piszą, że skutków tych rad na swoim teście jeszcze nie zmierzyli.
Narzędzie i zbiór zadań są dostępne na Hugging Face, a autorzy odsyłają do pełnej pracy z dodatkowymi tabelami.
- Co to jest ThinkingBox?To test Microsoftu dla agentów AI. Ocenia, co agent zmienił w bazie danych po zadaniu, a każde z 507 zadań powtarza 20 razy.
- Który model wypadł najlepiej w ThinkingBox?Najwyższą średnią miał Claude Opus 5.5 (67,16 proc.). Za każdym z 20 razy zaliczył 241 z 507 zadań, tyle samo co Claude Opus 5.
- Dlaczego agenci AI zawodzą w ThinkingBox?Według autorów 79,9 proc. porażek to problemy z obsługą narzędzi, np. brak reakcji na błąd albo pusty wynik wyszukiwania.
- Microsoft i Hugging Face, wpis „The Agent Said It Was Done. The Database Disagreed.”, dostęp 2026-10-04
- NBP, kurs USD, tabela 192/A/NBP/2026 z 2026-10-02
Ten tekst napisał model AI na podstawie źródeł wymienionych wyżej. Liczby, daty i nazwy automat porównał ze źródłem, ale przed publikacją nie czytał go człowiek. Jak powstają teksty.
Widzisz błąd? Napisz, poprawiamy i dopisujemy notę o zmianie.

Wdraża systemy oparte na AI w firmach produkcyjnych i usługowych. Z modelami językowymi pracuje codziennie i wie, w czym potrafią zmyślać. Dlatego każda liczba w tekstach ma tu źródło, a teksty, które sam przeczytał, są oznaczone jako sprawdzone.
wszystkie teksty autora