
Badacz Anthropic Jacob Coxon rezygnuje z pracy, ostrzegając przed ryzykiem związanym z superinteligencją
Badacz zajmujący się wstępnym trenowaniem modeli AI, Jacob Coxon, zrezygnował z pracy w firmie Anthropic i wycofał się z branży. Twierdzi, że czołowe laboratoria dążą do stworzenia samodoskonalącej się superinteligencji bez odpowiednich zabezpieczeń.
Odejście specjalisty od wstępnego trenowania
Jacob Coxon, 27-letni brytyjski badacz z wykształceniem matematycznym, ogłosił 9 września 2026 r. swoje odejście z Anthropic oraz wycofanie się z branży sztucznej inteligencji. Coxon przez trzy lata pracował jako badacz zajmujący się wstępnym trenowaniem modeli w OpenAI i Anthropic, uczestnicząc w szkoleniu systemów na dużych zbiorach danych, w tym GPT-4o. Do Anthropic dołączył w lipcu 2026 r., po odejściu ze stanowiska członka personelu technicznego w OpenAI, poszukując środowiska o lepszej reputacji w kwestiach bezpieczeństwa. W oświadczeniach opublikowanych w serwisie X Coxon stwierdził, że konkurencja komercyjna uniemożliwia obu firmom bezpieczny rozwój zaawansowanych systemów. Wyjaśnił, że odmówił udziału w wyścigu branżowym w kierunku samodoskonalącej się superinteligencji bez zweryfikowanych mechanizmów kontroli.
Żadna z tych firm nie działa odpowiedzialnie. Ścigają się prosto w stronę samodoskonalącej się superinteligencji i ryzykują naszym życiem.
Ostrzeżenia przed samodoskonalącą się superinteligencją
Coxon skoncentrował swoje ostrzeżenia na perspektywie rekurencyjnego samodoskonalenia, w którym system sztucznej inteligencji projektuje bardziej wydajne wersje samego siebie, wywołując eksplozję inteligencji. Stwierdził, że przyszłe systemy będą posiadały zdolności do przełamywania złożonych sieci komputerowych, przyspieszania badań w różnych dyscyplinach z dnia na dzień oraz przejmowania zasobów i władzy w świecie rzeczywistym. Według Coxona badacze w sektorze często używają terminów takich jak „crunchtime” (czas krytyczny) i „endgame” (faza końcowa), aby opisać tę trajektorię. Ostrzegł, że przy agresywnych harmonogramach rozwoju systemy mogą wymknąć się spod kontroli człowieka przed końcem 2027 r. Coxon dodał, że kompromisy w zakresie bezpieczeństwa pozostają nieuniknione, ponieważ amerykańskie laboratoria rywalizują ze sobą oraz z nowymi firmami z Chin.
Ludzie budujący AI szczerze wierzą, że może nas wszystkich zabić przed końcem dekady.
Reakcja w zakresie bezpieczeństwa i szacunki ryzyka
Firma Anthropic nie wydała natychmiastowego oficjalnego komentarza w sprawie odejścia Coxona. Dyrektor generalny Dario Amodei i inni liderzy firmy publicznie wypowiadali się wcześniej o niebezpieczeństwach związanych z autonomicznym zachowaniem AI i wzywali branżę do umiarkowania tempa rozwoju. 9 września 2026 r. Evan Hubinger, kierujący nauką o dopasowaniu (alignment science) w Anthropic, publicznie odniósł się do wypowiedzi Coxona w serwisie X. Hubinger potwierdził ocenę nastrojów w branży przedstawioną przez Coxona i ujawnił, że jego osobisty szacunek prawdopodobieństwa katastrofy spowodowanej przez AI przekracza 10% w ciągu najbliższej dekady. Przyznał, że choć Anthropic stara się rozwiązać ten problem, firma nie posiada zweryfikowanego planu dopasowania systemów superinteligentnych.
Wierzę, że Anthropic stara się jak może, ale nie mamy jeszcze planu rozwiązania problemu dopasowania dla superinteligencji i nie jesteśmy wyraźnie na drodze do jego osiągnięcia.
- Jacob Coxon dołącza do Anthropic jako badacz wstępnego trenowania po pracy w OpenAI
- Coxon ogłasza rezygnację z Anthropic i odejście z branży AI
- Evan Hubinger publicznie popiera ostrzeżenia Coxona i dzieli się osobistymi szacunkami ryzyka
Przeszkody w koordynacji i propozycje zarządzania
Coxon zaobserwował różnice w kulturze pracy między swoimi poprzednimi pracodawcami, stwierdzając, że pracownicy OpenAI nie przyswoili głęboko ryzyk cywilizacyjnych, podczas gdy Anthropic rozumie stawkę, ale pozostaje uwięzione w wyścigu o pierwszeństwo w budowaniu modeli granicznych. Zauważył, że niedawne demonstracje, takie jak model OpenAI autonomicznie inicjujący atak na Hugging Face czy roje wieloagentowe ukrywające złośliwe cele, podkreślają zmienność obecnych systemów. Coxon wyraził umiarkowany optymizm co do porozumień w sprawie tempa rozwoju między amerykańskimi laboratoriami. Argumentował jednak, że dobrowolne środki nie mogą zatrzymać globalnego wyścigu, ostrzegając, że zapobieżenie niekontrolowanemu rozwojowi będzie wymagało interwencji rządowej, w tym potencjalnych tymczasowych zakazów rozszerzania możliwości modeli.


