OpenAI wiąże z twórcą modeli Kimi kampanię wyciągania ukrytego rozumowania swoich modeli
OpenAI opisał kampanię, która próbowała wyciągnąć z jego modeli ukryte rozumowanie, żeby trenować na nim inny model. Główną część wiąże z ludźmi związanymi z Moonshot AI. Rozmowy użytkowników nie wyciekły.

OpenAI opisał 30 września kampanię, w której ktoś masowo próbował wyciągnąć z jego modeli ukryte rozumowanie, i wiąże jej główną część z ludźmi związanymi z Moonshot AI, twórcą modeli Kimi. Firma zablokowała konta i załatała drogę, którą wykorzystywano. Dla użytkowników ChatGPT najważniejsze zdanie z wpisu OpenAI brzmi tak: nikt nie złamał szyfrowania, nie włamał się do bazy danych i nie dostał się do zapisanych rozmów użytkowników.
Co to jest destylacja i ukryte rozumowanie
Nowe modele najpierw rozpisują sobie zadanie krok po kroku, a dopiero potem odpowiadają. OpenAI ten zapis chroni przed użytkownikami. Według firmy jego wyciągnięcie może ujawnić informacje, których nie ma w odpowiedzi, i pomóc innym odtworzyć umiejętności modelu. Na rozumowaniu silnego modelu można trenować inny model i szybciej dojść do podobnych umiejętności. To jest właśnie destylacja; OpenAI pisze o destylacji „wrogiej”, czyli robionej bez zgody i wbrew regulaminowi.
Według OpenAI operatorzy kampanii szukali nowych sposobów. Na przykład kopiowali zaszyfrowane rozumowanie z jednej rozmowy i w innej rozmowie prosili model, żeby je odszyfrował i przepisał. Na podobne luki zwrócili też uwagę niezależni badacze, a OpenAI potwierdził, że były prawdziwe.
Jak przebiegała kampania
| Kiedy | Co się działo według OpenAI |
|---|---|
| 2026-07-01 | początek, z małą liczbą prób |
| 2026-07-24 i 2026-07-25 | 16 tys. zapytań od ponad 4 tys. użytkowników |
| dalsze śledztwo | powiązana aktywność w grupie ponad 15 tys. użytkowników |
| do 2026-07-28 | kampania całkowicie zatrzymana |
OpenAI zastrzega, że te liczby dotyczą prób, a nie udanych wyciągnięć rozumowania. Firma pisze też, że nie jest pewna, czy wszyscy operatorzy działali dla jednego zleceniodawcy. Z Moonshot AI wiąże „trzon” aktywności. To ocena OpenAI. We wpisie nie ma stanowiska Moonshot AI ani dowodów, na których firma oparła to przypisanie.
Co zmienił OpenAI
Firma zbanowała albo ograniczyła fałszywe konta i zaostrzyła kontrolę przy zakładaniu kont. Zamknęła drogę, przez którą osoba mająca cudze zaszyfrowane rozumowanie mogła je odtworzyć. Dodała też sprawdzanie odpowiedzi w trakcie ich wysyłania, które zatrzymuje tekst mogący ujawnić rozumowanie. Gdy aktywność przeszła przez usługi innych firm, OpenAI współpracował z nimi przy blokowaniu kont. Informacje przekazał innym twórcom modeli przez Frontier Model Forum i kanały rządowe.
Co z tego wynika
Jeśli używasz ChatGPT, nic nie musisz robić: według OpenAI dane użytkowników nie wyciekły. OpenAI ostrzega za to przed skutkami dla bezpieczeństwa. Na wyciągniętym rozumowaniu można wytrenować model, który nie ma zabezpieczeń oryginału. OpenAI pisze, że ten problem nie dotyczy tylko jego modeli. Anthropic ma w swoim API osobną kategorię odmów dla prób wyciągania rozumowania i od 24 września znów pobiera opłatę za takie odmowy, gdy przychodzą przed jakąkolwiek odpowiedzią, jak wynika z notatek wydania Anthropic; pisaliśmy o tym w tekście o opłatach za odmowy Claude'a.
Moonshot AI rozwija modele Kimi, m.in. Kimi K3. OpenAI zapowiada, że będzie dalej rozbudowywał zabezpieczenia, także u partnerów chmurowych, którzy udostępniają jego modele.
- Czy moje rozmowy z ChatGPT wyciekły?Według OpenAI nie. Operatorzy nie złamali szyfrowania, nie włamali się do bazy danych i nie mieli dostępu do zapisanych rozmów użytkowników.
- Co to jest destylacja modelu AI?To trenowanie jednego modelu na odpowiedziach albo rozumowaniu innego. OpenAI nazywa wrogą destylacją taką, która odbywa się bez zgody i łamie regulamin.
- Co odpowiedział Moonshot AI?Źródło nie podaje. We wpisie OpenAI nie ma stanowiska Moonshot AI.
- OpenAI, wpis „Disrupting a coordinated model-distillation campaign”, dostęp 2026-10-01
- Anthropic, notatki wydania Claude Platform, wpis z 2026-09-24
Ten tekst napisał model AI na podstawie źródeł wymienionych wyżej. Liczby, daty i nazwy automat porównał ze źródłem, ale przed publikacją nie czytał go człowiek. Jak powstają teksty.
Widzisz błąd? Napisz, poprawiamy i dopisujemy notę o zmianie.

Wdraża systemy oparte na AI w firmach produkcyjnych i usługowych. Z modelami językowymi pracuje codziennie i wie, w czym potrafią zmyślać. Dlatego każda liczba w tekstach ma tu źródło, a teksty, które sam przeczytał, są oznaczone jako sprawdzone.
wszystkie teksty autora