Badania

GitHub ReviewBench sprawdza, jak AI przegląda kod. Test jest otwarty dla każdego agenta

GitHub opublikował ReviewBench, otwarty test agentów AI, które przeglądają kod przed wdrożeniem. Pozwala porównać, ile błędów agent znajduje i ile jego uwag to szum.

Łukasz Niesyto
prowadzi serwis · wdraża systemy AI w firmach
Opublikowano 2 min czytania
AITekst przygotowany przez AI na podstawie źródła: github.blog · jak powstaje
Zdjęcie: lupa jubilerska leżąca na wydruku kodu programu, przez soczewkę widać pęknięcie w kształcie owada

GitHub udostępnił 5 października ReviewBench, otwarty test, który sprawdza, jak dobrze AI przegląda kod. Przegląd kodu to etap, na którym ktoś czyta zmiany w programie, zanim trafią do użytku, i wyłapuje błędy. Coraz częściej robi to agent AI, na przykład Copilot od GitHuba. Test przyda się firmom, które wybierają takie narzędzie albo płacą za nie programistom. GitHub opisał ReviewBench na swoim blogu.

Na czym AI jest sprawdzane

GitHub przeanalizował 103,9 mln zgłoszeń zmian w kodzie ze swojego serwisu. Na tej podstawie wybrał 219 takich zgłoszeń z 187 publicznych projektów open source, w 19 językach programowania. Proporcje języków i wielkości projektów odpowiadają całemu GitHubowi, ale firma celowo dała mniej drobnych poprawek w jednym pliku, a więcej większych zmian.

Do każdej zmiany GitHub zebrał listę prawdziwych problemów z kilku źródeł: od ludzi, którzy przeglądali kod, z późniejszych poprawek autorów, z automatycznych narzędzi do analizy kodu i od kilku dużych modeli językowych. Problem trafia na listę tylko wtedy, gdy jest prawdziwy, ważny i niebanalny. Ocenia to model Claude Sonnet 5 według opublikowanych kryteriów. Doświadczeni inżynierowie, którzy nie budowali testu, oznaczyli wszystko od nowa i zgodzili się z oceną w 96,6 proc. przypadków.

Dwie miary, które warto znać

Wynik każdego agenta składa się z dwóch liczb. Precyzja mówi, jaka część uwag agenta jest trafna, czyli ile w nich szumu. Czułość mówi, jaką część znanych problemów agent znalazł. To jak z filtrem spamu: jeden przepuszcza mało spamu, ale czasem wycina dobre maile, drugi odwrotnie. ReviewBench pozwala przeliczyć ranking zależnie od tego, co jest dla zespołu ważniejsze, i pokazać wyniki osobno dla błędów krytycznych, bezpieczeństwa czy testów.

Co GitHub sprawdził na Copilocie

GitHub używa ReviewBench do ulepszania przeglądów w Copilocie. W jednym eksperymencie połączył kilka niezależnych przebiegów modelu w jeden przegląd. Test przewidział poprawę, a późniejszy eksperyment na prawdziwych użytkownikach ją potwierdził:

Miara w eksperymencie GitHubaZmiana
Uwagi, po których programista poprawił kod+8,0 proc.
Czułość+13,6 proc.
Liczba uwag+61 proc.
Koszt jednego przeglądu−8,0 proc.
Uwagi krytyczne (przewidywanie testu / wynik u użytkowników)+227 proc. / +262 proc.

To wyniki podane przez GitHub dla jego własnego produktu, w eksperymencie, który prowadził sam. Jeśli twój zespół korzysta z Copilota, sprawdź też, które modele GitHub właśnie z niego wycofał.

Jak sprawdzić własnego agenta

Zbiór danych, kryteria oceny i program do uruchamiania testu są publiczne, a wpis nie wymienia ograniczeń dla krajów, więc mogą z nich korzystać także zespoły w Polsce. Twórca agenta loguje się kontem GitHub, rejestruje agenta i podaje własny klucz do modelu. Najpierw może ćwiczyć na 25 zgłoszeniach. Pełny przebieg obejmuje wszystkie 219 zgłoszeń, trzy razy. Wyniki zostają prywatne, dopóki nie zatwierdzi ich opiekun testu. Na tablicę wyników trafia tylko pierwszy wynik agenta albo wynik lepszy od poprzedniego.

Wpis GitHuba nie podaje wyników konkurencyjnych agentów; według firmy są na tablicy wyników na stronie ReviewBench. Test ma status wersji badawczej.

Źródła
  1. GitHub, wpis „ReviewBench: An open benchmark for AI code review”, dostęp 2026-10-06

Ten tekst napisał model AI na podstawie źródeł wymienionych wyżej. Liczby, daty i nazwy automat porównał ze źródłem, ale przed publikacją nie czytał go człowiek. Jak powstają teksty.

Widzisz błąd? Napisz, poprawiamy i dopisujemy notę o zmianie.

Łukasz Niesyto
Łukasz Niesyto

Wdraża systemy oparte na AI w firmach produkcyjnych i usługowych. Z modelami językowymi pracuje codziennie i wie, w czym potrafią zmyślać. Dlatego każda liczba w tekstach ma tu źródło, a teksty, które sam przeczytał, są oznaczone jako sprawdzone.

wszystkie teksty autora

Powiązane

5 października 2026

ProvenanceGuard sprawdza, czy agent AI cytuje właściwe źródło

Badaniahuggingface.co2 min
4 października 2026

Microsoft ThinkingBox sprawdza agentów AI 20 razy. Claude Opus 5.5 zalicza bez błędu mniej niż połowę zadań

Badaniahuggingface.co3 min
3 października 2026

Satelita Google z chipami do AI działa na orbicie. Project Suncatcher zbiera pierwsze dane

Badaniablog.google2 min