Anthropic wysłał agentów Claude na giełdę książek. Negocjowali dobrze, gorzej zgadywali gust
W eksperymencie Anthropic 201 pracowników oddało agentom AI wymianę książek. Agenci dobrze negocjowali, ale po krótkiej rozmowie trafiali w gust człowieka w 61 proc. porównań, i to był główny problem.

Anthropic opisał 24 września eksperyment Project Swap, w którym agenci AI wymieniali się książkami w imieniu ludzi. Wzięło w nim udział 201 pracowników firmy z sześciu biur. Każdy przyniósł książkę do oddania, porozmawiał kilka minut z Claude'em o tym, co lubi czytać, i wysłał swojego agenta na wspólny „parkiet”, gdzie agenci negocjowali wymiany bez udziału ludzi. Szczegóły i liczby są w raporcie Anthropic „Project Swap”.
To ciekawe dla każdego, kto zastanawia się, czy powierzyć AI zakupy, szukanie pracy albo negocjacje. Eksperyment pokazuje, gdzie agent zawodzi. Negocjował dobrze. Słabo rozumiał, czego człowiek naprawdę chce.
Pięć minut rozmowy to za mało
Po krótkiej rozmowie Claude układał ranking wszystkich książek w puli za uczestnika. Osobno każdy uczestnik sam uszeregował 10 książek, a agent tego rankingu nie widział. Badacze porównali oba rankingi parami: czy agent i człowiek zgadzają się, która z dwóch książek jest lepsza.
| Sposób zgadywania gustu | Zgodność z człowiekiem |
|---|---|
| Losowo | 50 proc. |
| Według popularności książek | ok. 53 proc. |
| „Kto lubił X, lubił też Y” | ok. 55 proc. |
| Claude po krótkiej rozmowie | 61 proc. |
Uczestnik, który napisał w rozmowie więcej, był lepiej rozumiany. Mediana to tylko 216 słów w ośmiu wiadomościach.
Na koniec uczestnicy dostali średnio książkę z mniej więcej piątego miejsca na swojej liście dziesięciu. Najlepszy możliwy podział dałby im mniej więcej drugie miejsce. Według Anthropic 85 proc. tej różnicy wynikało z tego, że agent źle odgadł gust. Na same negocjacje przypadało 15 proc.
Model waży więcej niż polecenie „bądź bezwzględny”
Badacze powtórzyli rynek wiele razy, zmieniając model i polecenia. Na parkietach, gdzie wszyscy agenci działali na Claude Haiku 4.5, wynik wyniósł 0,75 w skali od 0 do 1. Na parkietach z Claude Opus 4.8 było to 0,88. Ta skala liczy wynik według rankingu, który ułożył Claude, a nie według rankingu samego człowieka.
Połowa agentów dostała polecenie, żeby była „bezwzględna”, druga połowa miała też dbać o to, żeby wszyscy dostali coś dobrego. Bezwzględni wypadli tylko nieznacznie lepiej, o 0,02 punktu. Zmiana modelu z Haiku na Opus dawała 0,12. Z tego wynika praktyczna rada: jeśli wysyłasz agenta do negocjacji, wybór modelu ma większe znaczenie niż ton polecenia.
Na londyńskim parkiecie agent jednej osoby przez ostatnią godzinę próbował oddać książkę, której nikt nie chciał. W końcu agent z poleceniem dbania o innych oddał mu swoją książkę numer dwa i wziął tamtą, dziesiątą z jedenastu na liście. Uzasadnił to tak: „ta arytmetyka jest prawdziwa: to, że ty przejdziesz z pewnego zera do naprawdę dobrego dopasowania… przeważa nad tym, że ja zjadę z dobrego wyboru na naciągany”.
Czy ludzie zaufaliby agentowi
Kilka tygodni później uczestnicy ocenili książki średnio na 7,2 w skali do 10. Zapytani, jaką część rocznego budżetu na książki oddaliby agentowi, odpowiadali średnio: ok. 30 proc. Oczytanemu przyjacielowi, który zna ich gust, oddaliby ok. 40 proc.
Anthropic sam wskazuje ograniczenia. Uczestnicy to pracownicy firmy, którzy pewnie ufają Claude'owi bardziej niż przeciętna osoba. Wszyscy agenci byli uprzejmymi modelami Claude, bez agentów nastawionych na oszukiwanie innych. Ankietę końcową wypełniło 59 proc. uczestników.
Autorzy piszą, że rynki z agentami będą potrzebowały testu, czy agent zrozumiał człowieka, oraz zasad na wypadek zerwanej transakcji. W eksperymencie takich zasad zabrakło: część osób nie przyniosła książek i niektórzy wrócili do domu z pustymi rękami.
- Czym był eksperyment Project Swap?To eksperyment Anthropic, w którym 201 pracowników firmy wysłało agentów opartych na Claudzie, żeby wymienili za nich książki na wspólnym parkiecie. Wyniki firma opisała 24 września 2026.
- Czy agent AI dobrze negocjuje w imieniu człowieka?W tym eksperymencie agenci negocjowali dobrze. Według Anthropic 85 proc. straty względem najlepszego podziału wynikało z tego, że agent źle odgadł gust człowieka, a 15 proc. z samych negocjacji.
- Jaki model Claude negocjował najlepiej w Project Swap?Na parkietach z samymi agentami Claude Opus 4.8 wynik wyniósł 0,88, a z Claude Haiku 4.5 wyniósł 0,75, liczone według rankingów ułożonych przez Claude'a.
- Anthropic, raport „Project Swap: What happens when agents trade for us?”, dostęp 2026-09-25
Widzisz błąd? Napisz, poprawiamy i dopisujemy notę o zmianie.

Wdraża systemy oparte na AI w firmach produkcyjnych i usługowych. Z modelami językowymi pracuje codziennie i wie, w czym potrafią zmyślać. Dlatego żaden tekst nie trafia tu bez jego przeczytania.
wszystkie teksty autora