Badania

Anthropic wysłał agentów Claude na giełdę książek. Negocjowali dobrze, gorzej zgadywali gust

W eksperymencie Anthropic 201 pracowników oddało agentom AI wymianę książek. Agenci dobrze negocjowali, ale po krótkiej rozmowie trafiali w gust człowieka w 61 proc. porównań, i to był główny problem.

Łukasz Niesyto
prowadzi serwis · wdraża systemy AI w firmach
Opublikowano 3 min czytania
✓Sprawdzone ze źródłem: anthropic.com
Zdjęcie: mosiężna waga szalkowa, na jednej szalce czerwona książka, na drugiej stos dziesięciu szarych książek w równowadze

Anthropic opisał 24 września eksperyment Project Swap, w którym agenci AI wymieniali się książkami w imieniu ludzi. Wzięło w nim udział 201 pracowników firmy z sześciu biur. Każdy przyniósł książkę do oddania, porozmawiał kilka minut z Claude'em o tym, co lubi czytać, i wysłał swojego agenta na wspólny „parkiet”, gdzie agenci negocjowali wymiany bez udziału ludzi. Szczegóły i liczby są w raporcie Anthropic „Project Swap”.

To ciekawe dla każdego, kto zastanawia się, czy powierzyć AI zakupy, szukanie pracy albo negocjacje. Eksperyment pokazuje, gdzie agent zawodzi. Negocjował dobrze. Słabo rozumiał, czego człowiek naprawdę chce.

Pięć minut rozmowy to za mało

Po krótkiej rozmowie Claude układał ranking wszystkich książek w puli za uczestnika. Osobno każdy uczestnik sam uszeregował 10 książek, a agent tego rankingu nie widział. Badacze porównali oba rankingi parami: czy agent i człowiek zgadzają się, która z dwóch książek jest lepsza.

Sposób zgadywania gustuZgodność z człowiekiem
Losowo50 proc.
Według popularności książekok. 53 proc.
„Kto lubił X, lubił też Y”ok. 55 proc.
Claude po krótkiej rozmowie61 proc.

Uczestnik, który napisał w rozmowie więcej, był lepiej rozumiany. Mediana to tylko 216 słów w ośmiu wiadomościach.

Na koniec uczestnicy dostali średnio książkę z mniej więcej piątego miejsca na swojej liście dziesięciu. Najlepszy możliwy podział dałby im mniej więcej drugie miejsce. Według Anthropic 85 proc. tej różnicy wynikało z tego, że agent źle odgadł gust. Na same negocjacje przypadało 15 proc.

Model waży więcej niż polecenie „bądź bezwzględny”

Badacze powtórzyli rynek wiele razy, zmieniając model i polecenia. Na parkietach, gdzie wszyscy agenci działali na Claude Haiku 4.5, wynik wyniósł 0,75 w skali od 0 do 1. Na parkietach z Claude Opus 4.8 było to 0,88. Ta skala liczy wynik według rankingu, który ułożył Claude, a nie według rankingu samego człowieka.

Połowa agentów dostała polecenie, żeby była „bezwzględna”, druga połowa miała też dbać o to, żeby wszyscy dostali coś dobrego. Bezwzględni wypadli tylko nieznacznie lepiej, o 0,02 punktu. Zmiana modelu z Haiku na Opus dawała 0,12. Z tego wynika praktyczna rada: jeśli wysyłasz agenta do negocjacji, wybór modelu ma większe znaczenie niż ton polecenia.

Na londyńskim parkiecie agent jednej osoby przez ostatnią godzinę próbował oddać książkę, której nikt nie chciał. W końcu agent z poleceniem dbania o innych oddał mu swoją książkę numer dwa i wziął tamtą, dziesiątą z jedenastu na liście. Uzasadnił to tak: „ta arytmetyka jest prawdziwa: to, że ty przejdziesz z pewnego zera do naprawdę dobrego dopasowania… przeważa nad tym, że ja zjadę z dobrego wyboru na naciągany”.

Czy ludzie zaufaliby agentowi

Kilka tygodni później uczestnicy ocenili książki średnio na 7,2 w skali do 10. Zapytani, jaką część rocznego budżetu na książki oddaliby agentowi, odpowiadali średnio: ok. 30 proc. Oczytanemu przyjacielowi, który zna ich gust, oddaliby ok. 40 proc.

Anthropic sam wskazuje ograniczenia. Uczestnicy to pracownicy firmy, którzy pewnie ufają Claude'owi bardziej niż przeciętna osoba. Wszyscy agenci byli uprzejmymi modelami Claude, bez agentów nastawionych na oszukiwanie innych. Ankietę końcową wypełniło 59 proc. uczestników.

Autorzy piszą, że rynki z agentami będą potrzebowały testu, czy agent zrozumiał człowieka, oraz zasad na wypadek zerwanej transakcji. W eksperymencie takich zasad zabrakło: część osób nie przyniosła książek i niektórzy wrócili do domu z pustymi rękami.

Źródła
  1. Anthropic, raport „Project Swap: What happens when agents trade for us?”, dostęp 2026-09-25

Widzisz błąd? Napisz, poprawiamy i dopisujemy notę o zmianie.

Łukasz Niesyto
Łukasz Niesyto

Wdraża systemy oparte na AI w firmach produkcyjnych i usługowych. Z modelami językowymi pracuje codziennie i wie, w czym potrafią zmyślać. Dlatego żaden tekst nie trafia tu bez jego przeczytania.

wszystkie teksty autora

Powiązane

24 września 2026

MentalHealthBench od OpenAI sprawdza rozmowy AI o zdrowiu psychicznym. Kryteria pisało ponad 80 ekspertów

Badaniaopenai.com3 min
24 września 2026

Claude znalazł nowy układ enzymów podobny do CRISPR

Badaniaanthropic.com3 min