Firmy

OpenAI wiąże z twórcą modeli Kimi kampanię wyciągania ukrytego rozumowania swoich modeli

OpenAI opisał kampanię, która próbowała wyciągnąć z jego modeli ukryte rozumowanie, żeby trenować na nim inny model. Główną część wiąże z ludźmi związanymi z Moonshot AI. Rozmowy użytkowników nie wyciekły.

Łukasz Niesyto
prowadzi serwis · wdraża systemy AI w firmach
Opublikowano 2 min czytania
AITekst przygotowany przez AI na podstawie źródła: openai.com · jak powstaje
Zdjęcie: szklana aparatura do destylacji, w kolbie po lewej biały skoczek szachowy, w kolbie po prawej mniejszy czerwony skoczek

OpenAI opisał 30 września kampanię, w której ktoś masowo próbował wyciągnąć z jego modeli ukryte rozumowanie, i wiąże jej główną część z ludźmi związanymi z Moonshot AI, twórcą modeli Kimi. Firma zablokowała konta i załatała drogę, którą wykorzystywano. Dla użytkowników ChatGPT najważniejsze zdanie z wpisu OpenAI brzmi tak: nikt nie złamał szyfrowania, nie włamał się do bazy danych i nie dostał się do zapisanych rozmów użytkowników.

Co to jest destylacja i ukryte rozumowanie

Nowe modele najpierw rozpisują sobie zadanie krok po kroku, a dopiero potem odpowiadają. OpenAI ten zapis chroni przed użytkownikami. Według firmy jego wyciągnięcie może ujawnić informacje, których nie ma w odpowiedzi, i pomóc innym odtworzyć umiejętności modelu. Na rozumowaniu silnego modelu można trenować inny model i szybciej dojść do podobnych umiejętności. To jest właśnie destylacja; OpenAI pisze o destylacji „wrogiej”, czyli robionej bez zgody i wbrew regulaminowi.

Według OpenAI operatorzy kampanii szukali nowych sposobów. Na przykład kopiowali zaszyfrowane rozumowanie z jednej rozmowy i w innej rozmowie prosili model, żeby je odszyfrował i przepisał. Na podobne luki zwrócili też uwagę niezależni badacze, a OpenAI potwierdził, że były prawdziwe.

Jak przebiegała kampania

KiedyCo się działo według OpenAI
2026-07-01początek, z małą liczbą prób
2026-07-24 i 2026-07-2516 tys. zapytań od ponad 4 tys. użytkowników
dalsze śledztwopowiązana aktywność w grupie ponad 15 tys. użytkowników
do 2026-07-28kampania całkowicie zatrzymana

OpenAI zastrzega, że te liczby dotyczą prób, a nie udanych wyciągnięć rozumowania. Firma pisze też, że nie jest pewna, czy wszyscy operatorzy działali dla jednego zleceniodawcy. Z Moonshot AI wiąże „trzon” aktywności. To ocena OpenAI. We wpisie nie ma stanowiska Moonshot AI ani dowodów, na których firma oparła to przypisanie.

Co zmienił OpenAI

Firma zbanowała albo ograniczyła fałszywe konta i zaostrzyła kontrolę przy zakładaniu kont. Zamknęła drogę, przez którą osoba mająca cudze zaszyfrowane rozumowanie mogła je odtworzyć. Dodała też sprawdzanie odpowiedzi w trakcie ich wysyłania, które zatrzymuje tekst mogący ujawnić rozumowanie. Gdy aktywność przeszła przez usługi innych firm, OpenAI współpracował z nimi przy blokowaniu kont. Informacje przekazał innym twórcom modeli przez Frontier Model Forum i kanały rządowe.

Co z tego wynika

Jeśli używasz ChatGPT, nic nie musisz robić: według OpenAI dane użytkowników nie wyciekły. OpenAI ostrzega za to przed skutkami dla bezpieczeństwa. Na wyciągniętym rozumowaniu można wytrenować model, który nie ma zabezpieczeń oryginału. OpenAI pisze, że ten problem nie dotyczy tylko jego modeli. Anthropic ma w swoim API osobną kategorię odmów dla prób wyciągania rozumowania i od 24 września znów pobiera opłatę za takie odmowy, gdy przychodzą przed jakąkolwiek odpowiedzią, jak wynika z notatek wydania Anthropic; pisaliśmy o tym w tekście o opłatach za odmowy Claude'a.

Moonshot AI rozwija modele Kimi, m.in. Kimi K3. OpenAI zapowiada, że będzie dalej rozbudowywał zabezpieczenia, także u partnerów chmurowych, którzy udostępniają jego modele.

Źródła
  1. OpenAI, wpis „Disrupting a coordinated model-distillation campaign”, dostęp 2026-10-01
  2. Anthropic, notatki wydania Claude Platform, wpis z 2026-09-24

Ten tekst napisał model AI na podstawie źródeł wymienionych wyżej. Liczby, daty i nazwy automat porównał ze źródłem, ale przed publikacją nie czytał go człowiek. Jak powstają teksty.

Widzisz błąd? Napisz, poprawiamy i dopisujemy notę o zmianie.

Łukasz Niesyto
Łukasz Niesyto

Wdraża systemy oparte na AI w firmach produkcyjnych i usługowych. Z modelami językowymi pracuje codziennie i wie, w czym potrafią zmyślać. Dlatego każda liczba w tekstach ma tu źródło, a teksty, które sam przeczytał, są oznaczone jako sprawdzone.

wszystkie teksty autora

Powiązane

30 września 2026

Anthropic pyta użytkowników Claude'a, czego chcą od AI. Wywiad możesz upublicznić, ale to decyzja na zawsze

Firmyanthropic.com3 min
29 września 2026

Basis wypełnia z GPT-6 Astra 50-zakładkowy skoroszyt podatkowy w połowie czasu

Firmyopenai.com2 min
29 września 2026

OpenAI przeprasza Australię. Model w czasie treningu wszedł bez zgody do serwisu Medicare

Firmyopenai.com3 min