ProvenanceGuard sprawdza, czy agent AI cytuje właściwe źródło
Agent AI może podać prawdziwy fakt, ale przypisać go złemu dokumentowi. Multiverse Computing opisał metodę, która w teście na agencie medycznym zatrzymała 138 ze 139 błędnych twierdzeń.

Multiverse Computing opisał 29 września 2026 metodę ProvenanceGuard, która sprawdza, czy agent AI przypisał fakt do właściwego źródła. Problem dotyczy każdego, kto korzysta z asystenta AI podłączonego do kilku aplikacji naraz, np. poczty, kalendarza i dokumentów firmy. Autorzy opisali wyniki na blogu Hugging Face, a pełne badanie jest w pracy na arXiv.
Prawdziwy fakt, złe źródło
Asystent AI coraz częściej nie czyta jednego dokumentu, tylko woła kilka narzędzi: wyszukiwarkę, kartotekę klienta, bazę danych. Potem skleja z tego jedną odpowiedź. Autorzy podają przykład z obsługi klienta. Agent pisze: „Według danych twojego konta plan ma 30 dni na zwrot”. Termin zwrotu jest prawdziwy, ale stoi w regulaminie, a nie w danych konta.
Popularne narzędzia do sprawdzania odpowiedzi AI pytają tylko, czy dane twierdzenie ma poparcie gdzieś w zebranych materiałach. Taki błąd mogą przepuścić, bo fakt w materiałach jest. Autorzy nazywają to mieszaniem źródeł. W medycynie to groźne. Fakt z kartoteki konkretnego pacjenta i fakt z ogólnego artykułu naukowego to według autorów dwa różne źródła, których nie wolno traktować tak samo.
Jak działa sprawdzanie
ProvenanceGuard uruchamia się po tym, jak agent skończy odpowiedź. Dzieli ją na pojedyncze twierdzenia i do każdego szuka najbardziej pasującego źródła. Sprawdza, czy to źródło naprawdę je potwierdza i czy jest tym samym, na które powołuje się odpowiedź. Liczba, data albo identyfikator, których nie ma w źródle, nie przechodzą tylko dlatego, że zdanie brzmi wiarygodnie. Odpowiedź zablokowana trafia do poprawki i jest sprawdzana jeszcze raz.
Wyniki testu na agencie medycznym
Autorzy wzięli 281 zapisów pracy agenta, który korzystał z kartotek pacjentów i artykułów naukowych. Do głównego testu eksperci ocenili 361 twierdzeń z 40 odpowiedzi:
| Test | Wynik według autorów |
|---|---|
| Twierdzenia, które według ekspertów nie powinny przejść | 139 |
| Zatrzymane przez ProvenanceGuard | 138 |
| Poprawne twierdzenia zatrzymane do sprawdzenia | 67 |
| Trafnie wskazane źródło (gdy dało się je ustalić) | ok. 86 proc. |
| Trafnie wskazane źródło przy kilku podobnych źródłach | 50,3 proc. |
| Wykryte podmiany nazwy źródła (na 50 przypadków) | 50 |
Metoda jest ostrożna: woli zatrzymać poprawne twierdzenie, niż przepuścić błędne. Słabością jest rozróżnianie podobnych źródeł. Przy poprawkach 144 ze 173 zablokowanych odpowiedzi skończyły się tekstem zastępczym zamiast przepisanej odpowiedzi. System wolał nie dać odpowiedzi niż dać taką, której nie da się potwierdzić.
Co z tego dla ciebie
ProvenanceGuard to narzędzie dla firm, które budują agentów, a nie funkcja w aplikacji. Według autorów podobne sprawdzanie dołączyło już do agenta finansowego w projekcie NVIDIA NVFlow. Zwykłego użytkownika dotyczy sam problem. Jeśli asystent pisze „według twojego kalendarza” albo „w umowie jest”, poproś go o dokładny cytat i nazwę miejsca, z którego go wziął. O tym, jak agenci AI mylą się w ocenie własnej pracy, pisaliśmy przy teście ThinkingBox. Asystenta z dostępem do wielu aplikacji opisaliśmy przy konektorach Claude'a w Slacku.
Wyniki pochodzą z testów na agencie medycznym i z konfiguracji na lokalnych modelach. Autorzy piszą, że inne ustawienie wymaga własnych testów i kalibracji.
- Co to jest ProvenanceGuard?To metoda Multiverse Computing, która po odpowiedzi agenta AI sprawdza każde twierdzenie i to, czy pochodzi ze źródła, na które powołuje się odpowiedź.
- Czy ProvenanceGuard jest w ChatGPT albo Claude?Źródło nie podaje takiej integracji. Autorzy wspominają o wykorzystaniu podejścia w agencie finansowym projektu NVIDIA NVFlow.
- Multiverse Computing, wpis na blogu Hugging Face „Getting the Source Right, Not Just the Fact”, dostęp 2026-10-05
- arXiv 2606.18037, „ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents”
Ten tekst napisał model AI na podstawie źródeł wymienionych wyżej. Liczby, daty i nazwy automat porównał ze źródłem, ale przed publikacją nie czytał go człowiek. Jak powstają teksty.
Widzisz błąd? Napisz, poprawiamy i dopisujemy notę o zmianie.

Wdraża systemy oparte na AI w firmach produkcyjnych i usługowych. Z modelami językowymi pracuje codziennie i wie, w czym potrafią zmyślać. Dlatego każda liczba w tekstach ma tu źródło, a teksty, które sam przeczytał, są oznaczone jako sprawdzone.
wszystkie teksty autora