GitHub ReviewBench sprawdza, jak AI przegląda kod. Test jest otwarty dla każdego agenta
GitHub opublikował ReviewBench, otwarty test agentów AI, które przeglądają kod przed wdrożeniem. Pozwala porównać, ile błędów agent znajduje i ile jego uwag to szum.

GitHub udostępnił 5 października ReviewBench, otwarty test, który sprawdza, jak dobrze AI przegląda kod. Przegląd kodu to etap, na którym ktoś czyta zmiany w programie, zanim trafią do użytku, i wyłapuje błędy. Coraz częściej robi to agent AI, na przykład Copilot od GitHuba. Test przyda się firmom, które wybierają takie narzędzie albo płacą za nie programistom. GitHub opisał ReviewBench na swoim blogu.
Na czym AI jest sprawdzane
GitHub przeanalizował 103,9 mln zgłoszeń zmian w kodzie ze swojego serwisu. Na tej podstawie wybrał 219 takich zgłoszeń z 187 publicznych projektów open source, w 19 językach programowania. Proporcje języków i wielkości projektów odpowiadają całemu GitHubowi, ale firma celowo dała mniej drobnych poprawek w jednym pliku, a więcej większych zmian.
Do każdej zmiany GitHub zebrał listę prawdziwych problemów z kilku źródeł: od ludzi, którzy przeglądali kod, z późniejszych poprawek autorów, z automatycznych narzędzi do analizy kodu i od kilku dużych modeli językowych. Problem trafia na listę tylko wtedy, gdy jest prawdziwy, ważny i niebanalny. Ocenia to model Claude Sonnet 5 według opublikowanych kryteriów. Doświadczeni inżynierowie, którzy nie budowali testu, oznaczyli wszystko od nowa i zgodzili się z oceną w 96,6 proc. przypadków.
Dwie miary, które warto znać
Wynik każdego agenta składa się z dwóch liczb. Precyzja mówi, jaka część uwag agenta jest trafna, czyli ile w nich szumu. Czułość mówi, jaką część znanych problemów agent znalazł. To jak z filtrem spamu: jeden przepuszcza mało spamu, ale czasem wycina dobre maile, drugi odwrotnie. ReviewBench pozwala przeliczyć ranking zależnie od tego, co jest dla zespołu ważniejsze, i pokazać wyniki osobno dla błędów krytycznych, bezpieczeństwa czy testów.
Co GitHub sprawdził na Copilocie
GitHub używa ReviewBench do ulepszania przeglądów w Copilocie. W jednym eksperymencie połączył kilka niezależnych przebiegów modelu w jeden przegląd. Test przewidział poprawę, a późniejszy eksperyment na prawdziwych użytkownikach ją potwierdził:
| Miara w eksperymencie GitHuba | Zmiana |
|---|---|
| Uwagi, po których programista poprawił kod | +8,0 proc. |
| Czułość | +13,6 proc. |
| Liczba uwag | +61 proc. |
| Koszt jednego przeglądu | −8,0 proc. |
| Uwagi krytyczne (przewidywanie testu / wynik u użytkowników) | +227 proc. / +262 proc. |
To wyniki podane przez GitHub dla jego własnego produktu, w eksperymencie, który prowadził sam. Jeśli twój zespół korzysta z Copilota, sprawdź też, które modele GitHub właśnie z niego wycofał.
Jak sprawdzić własnego agenta
Zbiór danych, kryteria oceny i program do uruchamiania testu są publiczne, a wpis nie wymienia ograniczeń dla krajów, więc mogą z nich korzystać także zespoły w Polsce. Twórca agenta loguje się kontem GitHub, rejestruje agenta i podaje własny klucz do modelu. Najpierw może ćwiczyć na 25 zgłoszeniach. Pełny przebieg obejmuje wszystkie 219 zgłoszeń, trzy razy. Wyniki zostają prywatne, dopóki nie zatwierdzi ich opiekun testu. Na tablicę wyników trafia tylko pierwszy wynik agenta albo wynik lepszy od poprzedniego.
Wpis GitHuba nie podaje wyników konkurencyjnych agentów; według firmy są na tablicy wyników na stronie ReviewBench. Test ma status wersji badawczej.
- Co to jest GitHub ReviewBench?To otwarty test od GitHuba, który ocenia agentów AI przeglądających kod. Składa się z 219 zgłoszeń zmian z 187 publicznych projektów w 19 językach programowania.
- Kto ocenia wyniki w ReviewBench?Uwagi agentów ocenia model Claude Sonnet 5 według opublikowanych kryteriów. Inżynierowie, którzy sprawdzili wzorcową listę problemów, zgodzili się z nią w 96,6 proc. przypadków.
- Czy mogę sprawdzić własnego agenta w ReviewBench?Tak. Potrzebne są konto GitHub, zarejestrowany agent i własny klucz do modelu. Wynik trafia na tablicę dopiero po zatwierdzeniu przez opiekuna testu.
- GitHub, wpis „ReviewBench: An open benchmark for AI code review”, dostęp 2026-10-06
Ten tekst napisał model AI na podstawie źródeł wymienionych wyżej. Liczby, daty i nazwy automat porównał ze źródłem, ale przed publikacją nie czytał go człowiek. Jak powstają teksty.
Widzisz błąd? Napisz, poprawiamy i dopisujemy notę o zmianie.

Wdraża systemy oparte na AI w firmach produkcyjnych i usługowych. Z modelami językowymi pracuje codziennie i wie, w czym potrafią zmyślać. Dlatego każda liczba w tekstach ma tu źródło, a teksty, które sam przeczytał, są oznaczone jako sprawdzone.
wszystkie teksty autora