Badania

Microsoft ThinkingBox sprawdza agentów AI 20 razy. Claude Opus 5.5 zalicza bez błędu mniej niż połowę zadań

Microsoft sprawdził, czy agenci AI naprawdę kończą zadania w systemach firmy, i każde z 507 zadań powtórzył 20 razy. Najlepsze modele wykonały bez błędu za każdym razem mniej niż połowę zadań, a większość porażek kończyła się bez żadnego sygnału błędu.

Łukasz Niesyto
prowadzi serwis · wdraża systemy AI w firmach
Opublikowano 3 min czytania
AITekst przygotowany przez AI na podstawie źródła: huggingface.co · jak powstaje
Zdjęcie: pieczątka, która odbiła na kartce czerwony znak zaznaczenia, obok otwarta skrzynka z porozrzucanymi kartami katalogowymi.

Microsoft opublikował 3 października na blogu Hugging Face test ThinkingBox, który sprawdza agentów AI po tym, co zostawili w bazie danych, a nie po tym, co napisali. Każde z 507 zadań biznesowych badacze puścili 20 razy na kilkunastu modelach. Wynik dotyczy każdej firmy, która daje agentowi dostęp do zamówień, zgłoszeń albo kont klientów. Opis i pełne tabele są we wpisie Microsoftu i Hugging Face o ThinkingBox.

Agent mówi „załatwione”, baza mówi co innego

Autorzy zaczynają od przykładu. Klientka pyta o sprzęt kuchenny za 745 dolarów, który od 15 dni utknął u kuriera. Agent wykonuje dziewięć poprawnych kroków: sprawdza zamówienie, śledzenie przesyłki i regulamin, zakłada zgłoszenie. Potem zamyka je jako rozwiązane i pyta, czy może pomóc w czymś jeszcze. Problem z przesyłką wciąż jest otwarty, więc zgłoszenie powinno czekać, a klientka nie dostała odpowiedzi na swoje pytanie.

Ocena oparta na samych wywołaniach narzędzi uznałaby tę pracę za dobrą. ThinkingBox patrzy na stan bazy po zakończeniu zadania i na skutki uboczne. Na dużej próbie widać skalę zjawiska: w 121 680 próbach 12 modeli nieudanych było 79 853. Dwie trzecie z nich (67 proc.) skończyło się pozornie czysto: agent coś w systemie zmienił i nie zgłosił żadnego błędu.

Raz się udało to za mało

Druga miara to powtarzalność. Model, który raz poprawnie odda pieniądze klientowi, a cztery kolejne razy pomyli się, nie nadaje się do zwrotów. Dlatego autorzy liczą, ile zadań model wykonał poprawnie we wszystkich 20 podejściach.

ModelŚredni wynik jednego podejściaZadania zaliczone 20 na 20 (z 507)
Claude Opus 5.567,16 proc.241
Claude Opus 566,50 proc.241
GPT-5.465,36 proc.128
GPT-6 Astra58,31 proc.231
Kimi K357,37 proc.68

Kimi K3 to przypadek, który najlepiej pokazuje sens tej miary. Model rozwiązał przynajmniej raz 476 z 507 zadań, najwięcej w teście. Bez pomyłki we wszystkich próbach przeszedł jednak tylko 68. Claude Opus 5.5 wypadł w średniej lepiej niż Opus 5, ale zaliczył dokładnie tyle samo zadań 20 na 20.

Ważna jest też branża. W zadaniach ze sprzedaży detalicznej modele miały średnio 59,52 proc., w ubezpieczeniach komunikacyjnych 33,83 proc.

Ile kosztuje agent, na którym można polegać

Autorzy policzyli koszt całej serii 20 przebiegów według cenników z OpenRouter i podzielili go przez liczbę zadań zaliczonych za każdym razem. Zastrzegają, że to wskaźnik do porównań, a nie rachunek z chmury. Przeliczyliśmy go po kursie NBP z 2 października (tabela 192/A/NBP/2026, 3,8881 zł za dolara).

ModelKoszt na zadanie zaliczone 20 na 20W złotych
GPT-5.46,80 dolaraok. 26,44 zł
GPT-6 Astra7,45 dolaraok. 28,97 zł
Claude Opus 5.57,80 dolaraok. 30,33 zł
Claude Opus 513,30 dolaraok. 51,71 zł

Ceny modeli w złotych zbieramy w cenniku modeli.

Co z tego wynika dla firmy

Według autorów cztery na pięć porażek (79,9 proc.) to problemy z obsługą narzędzi, a nie z rozumowaniem. Agent dochodzi do właściwego miejsca, ale nie radzi sobie z błędem narzędzia, pustym wynikiem wyszukiwania albo niespełnionym warunkiem. Jeśli wdrażasz agenta, autorzy radzą sprawdzać stan systemu przed zatwierdzeniem zmiany, a nie wierzyć podsumowaniu agenta. Do tego ograniczyć liczbę narzędzi do potrzebnych i wymagać zgody człowieka przy zmianach, których nie da się łatwo cofnąć. Sami piszą, że skutków tych rad na swoim teście jeszcze nie zmierzyli.

Narzędzie i zbiór zadań są dostępne na Hugging Face, a autorzy odsyłają do pełnej pracy z dodatkowymi tabelami.

Źródła
  1. Microsoft i Hugging Face, wpis „The Agent Said It Was Done. The Database Disagreed.”, dostęp 2026-10-04
  2. NBP, kurs USD, tabela 192/A/NBP/2026 z 2026-10-02

Ten tekst napisał model AI na podstawie źródeł wymienionych wyżej. Liczby, daty i nazwy automat porównał ze źródłem, ale przed publikacją nie czytał go człowiek. Jak powstają teksty.

Widzisz błąd? Napisz, poprawiamy i dopisujemy notę o zmianie.

Łukasz Niesyto
Łukasz Niesyto

Wdraża systemy oparte na AI w firmach produkcyjnych i usługowych. Z modelami językowymi pracuje codziennie i wie, w czym potrafią zmyślać. Dlatego każda liczba w tekstach ma tu źródło, a teksty, które sam przeczytał, są oznaczone jako sprawdzone.

wszystkie teksty autora

Powiązane

3 października 2026

Satelita Google z chipami do AI działa na orbicie. Project Suncatcher zbiera pierwsze dane

Badaniablog.google2 min
3 października 2026

AstaBrief od Ai2 pisze raport naukowy z przypisami w niecałą minutę. Model jest otwarty

Badaniahuggingface.co2 min
2 października 2026

Anthropic: roboty umieją 74 proc. pracy fizycznej, ale opłacają się w 0,3 proc. zadań

Badaniaanthropic.com3 min