Badania

ProvenanceGuard sprawdza, czy agent AI cytuje właściwe źródło

Agent AI może podać prawdziwy fakt, ale przypisać go złemu dokumentowi. Multiverse Computing opisał metodę, która w teście na agencie medycznym zatrzymała 138 ze 139 błędnych twierdzeń.

Łukasz Niesyto
prowadzi serwis · wdraża systemy AI w firmach
Opublikowano 2 min czytania
AITekst przygotowany przez AI na podstawie źródła: huggingface.co · jak powstaje
Zdjęcie: trzy mosiężne skrzynki pocztowe w rzędzie, z jednej wystaje czerwony list

Multiverse Computing opisał 29 września 2026 metodę ProvenanceGuard, która sprawdza, czy agent AI przypisał fakt do właściwego źródła. Problem dotyczy każdego, kto korzysta z asystenta AI podłączonego do kilku aplikacji naraz, np. poczty, kalendarza i dokumentów firmy. Autorzy opisali wyniki na blogu Hugging Face, a pełne badanie jest w pracy na arXiv.

Prawdziwy fakt, złe źródło

Asystent AI coraz częściej nie czyta jednego dokumentu, tylko woła kilka narzędzi: wyszukiwarkę, kartotekę klienta, bazę danych. Potem skleja z tego jedną odpowiedź. Autorzy podają przykład z obsługi klienta. Agent pisze: „Według danych twojego konta plan ma 30 dni na zwrot”. Termin zwrotu jest prawdziwy, ale stoi w regulaminie, a nie w danych konta.

Popularne narzędzia do sprawdzania odpowiedzi AI pytają tylko, czy dane twierdzenie ma poparcie gdzieś w zebranych materiałach. Taki błąd mogą przepuścić, bo fakt w materiałach jest. Autorzy nazywają to mieszaniem źródeł. W medycynie to groźne. Fakt z kartoteki konkretnego pacjenta i fakt z ogólnego artykułu naukowego to według autorów dwa różne źródła, których nie wolno traktować tak samo.

Jak działa sprawdzanie

ProvenanceGuard uruchamia się po tym, jak agent skończy odpowiedź. Dzieli ją na pojedyncze twierdzenia i do każdego szuka najbardziej pasującego źródła. Sprawdza, czy to źródło naprawdę je potwierdza i czy jest tym samym, na które powołuje się odpowiedź. Liczba, data albo identyfikator, których nie ma w źródle, nie przechodzą tylko dlatego, że zdanie brzmi wiarygodnie. Odpowiedź zablokowana trafia do poprawki i jest sprawdzana jeszcze raz.

Wyniki testu na agencie medycznym

Autorzy wzięli 281 zapisów pracy agenta, który korzystał z kartotek pacjentów i artykułów naukowych. Do głównego testu eksperci ocenili 361 twierdzeń z 40 odpowiedzi:

TestWynik według autorów
Twierdzenia, które według ekspertów nie powinny przejść139
Zatrzymane przez ProvenanceGuard138
Poprawne twierdzenia zatrzymane do sprawdzenia67
Trafnie wskazane źródło (gdy dało się je ustalić)ok. 86 proc.
Trafnie wskazane źródło przy kilku podobnych źródłach50,3 proc.
Wykryte podmiany nazwy źródła (na 50 przypadków)50

Metoda jest ostrożna: woli zatrzymać poprawne twierdzenie, niż przepuścić błędne. Słabością jest rozróżnianie podobnych źródeł. Przy poprawkach 144 ze 173 zablokowanych odpowiedzi skończyły się tekstem zastępczym zamiast przepisanej odpowiedzi. System wolał nie dać odpowiedzi niż dać taką, której nie da się potwierdzić.

Co z tego dla ciebie

ProvenanceGuard to narzędzie dla firm, które budują agentów, a nie funkcja w aplikacji. Według autorów podobne sprawdzanie dołączyło już do agenta finansowego w projekcie NVIDIA NVFlow. Zwykłego użytkownika dotyczy sam problem. Jeśli asystent pisze „według twojego kalendarza” albo „w umowie jest”, poproś go o dokładny cytat i nazwę miejsca, z którego go wziął. O tym, jak agenci AI mylą się w ocenie własnej pracy, pisaliśmy przy teście ThinkingBox. Asystenta z dostępem do wielu aplikacji opisaliśmy przy konektorach Claude'a w Slacku.

Wyniki pochodzą z testów na agencie medycznym i z konfiguracji na lokalnych modelach. Autorzy piszą, że inne ustawienie wymaga własnych testów i kalibracji.

Źródła
  1. Multiverse Computing, wpis na blogu Hugging Face „Getting the Source Right, Not Just the Fact”, dostęp 2026-10-05
  2. arXiv 2606.18037, „ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents”

Ten tekst napisał model AI na podstawie źródeł wymienionych wyżej. Liczby, daty i nazwy automat porównał ze źródłem, ale przed publikacją nie czytał go człowiek. Jak powstają teksty.

Widzisz błąd? Napisz, poprawiamy i dopisujemy notę o zmianie.

Łukasz Niesyto
Łukasz Niesyto

Wdraża systemy oparte na AI w firmach produkcyjnych i usługowych. Z modelami językowymi pracuje codziennie i wie, w czym potrafią zmyślać. Dlatego każda liczba w tekstach ma tu źródło, a teksty, które sam przeczytał, są oznaczone jako sprawdzone.

wszystkie teksty autora

Powiązane

4 października 2026

Microsoft ThinkingBox sprawdza agentów AI 20 razy. Claude Opus 5.5 zalicza bez błędu mniej niż połowę zadań

Badaniahuggingface.co3 min
3 października 2026

Satelita Google z chipami do AI działa na orbicie. Project Suncatcher zbiera pierwsze dane

Badaniablog.google2 min
3 października 2026

AstaBrief od Ai2 pisze raport naukowy z przypisami w niecałą minutę. Model jest otwarty

Badaniahuggingface.co2 min