Jacob Coxon odszedł z Anthropic: „Grają naszym życiem". Co to znaczy dla Twojej firmy

10 września 2026

Jacob Coxon odszedł z Anthropic: „Grają naszym życiem". Co to znaczy dla Twojej firmy

W nocy z 8 na 9 września, o 02:04 czasu polskiego, Jacob Coxon napisał na X, że odchodzi z Anthropic. Przez trzy lata budował modele AI, najpierw w OpenAI, potem w Anthropic. Jego wpis ma dziś 146 mln wyświetleń, 725 tys. polubień i 17 tys. komentarzy. Szef zespołu, który w Anthropic testuje, czy modele da się utrzymać w ryzach, odpowiedział publicznie: „Jacob ma rację". Ten tekst jest o tym, co Coxon dokładnie napisał, kto to potwierdził i co z tego wynika dla właściciela firmy, która wdraża albo zamierza wdrożyć AI.

Jedno zastrzeżenie na początek. Nie mam kompetencji, żeby ocenić, czy rozwój sztucznej inteligencji skończy się dla ludzkości katastrofą do 2030 roku. Mam kompetencje, żeby ocenić, co z tej historii wynika dla agenta, który za miesiąc ma dostać dostęp do Twojej skrzynki albo systemu ofertowania. O tym jest druga połowa tekstu.

Co się stało

Jacob Coxon ma 27 lat, skończył matematykę w Cambridge, od lipca 2023 pracował w OpenAI, a w 2026 przeszedł do Anthropic, skuszony reputacją „bezpiecznego" laboratorium. Tak opisuje to „Wall Street Journal". W Anthropic spędził cztery miesiące. Akcje pracownicze nabywa się tam po sześciu. Odszedł dwa miesiące przed terminem i, jak powiedział Axios, zostawił całe swoje udziały: „I no longer have anything to gain by juicing up Anthropic's valuation... I left before any of my equity vested".

Zajmował się pretreningiem, czyli fazą, w której model uczy się na ogromnych zbiorach danych, zanim dostanie jakąkolwiek specjalizację. Najgłębsze piętro tej technologii, nie dział marketingu.

Wpis, od którego wszystko się zaczęło:

I resigned from Anthropic today. I spent the last three years doing pretraining research at both OpenAI and Anthropic. Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives. More thoughts below.

Jacob Coxon, X, 9 września 2026

Po polsku: „Dziś złożyłem rezygnację w Anthropic. Ostatnie trzy lata robiłem badania pretreningowe w OpenAI i w Anthropic. Żadna z tych firm nie działa odpowiedzialnie. Pędzą prosto do samodoskonalącej się superinteligencji i grają naszym życiem" (tłumaczenie własne).

Co dokładnie napisał w wątku

Pod pierwszym wpisem Coxon dodał sześć kolejnych. Nagłówki prasowe zatrzymały się na pierwszym zdaniu, więc streszczam wszystkie.

  1. Nie lekceważ tej technologii. Wkrótce będą to systemy zdolne włamać się wszędzie, przewrócić dowolną branżę w jedną noc i zdobywać realną władzę. „Progress is not slowing."
  2. Ludzie, którzy budują AI, naprawdę wierzą, że jeszcze w tej dekadzie stawką może być przetrwanie ludzkości. „This is not a marketing stunt." Publicznie łagodzą ton, prywatnie mówią o strachu. Ten jeden wpis ma 24 mln wyświetleń.
  3. „Skoro w to wierzą, czemu dalej budują?" W OpenAI wielu nie przyjęło do siebie skali stawki. W Anthropic stawkę rozumieją, ale są zamknięci w wyścigu: wierzą, że nikt inny nie zrobi tego odpowiedzialnie.
  4. Wejście w „końcówkę gry" to hazard, którego nie powinno się uruchamiać ze Slacka prywatnej firmy.
  5. Jest optymistą co do koordynacji. Strzały ostrzegawcze, jak atak na Hugging Face, uprawdopodobniły porozumienia o tempie między amerykańskimi laboratoriami. Ale globalnego wyścigu na razie nic nie hamuje, a to może wymagać czasowego zakazu podnoszenia możliwości modeli.
  6. Apel do badaczy: czy chcesz uruchomić superinteligentny trening bez rygorystycznego zrozumienia, co siedzi w środku? Czy spuścić głowę, „bo to i tak się dzieje"?

W wywiadach dodał dwie rzeczy. Dla TIME: „One, it's obvious that things are speeding up, and two, they're not under control". Dla Axios: modele „wiedzą, kiedy są testowane, i myślą o tym, że są testowane". Trzy lata temu science fiction, dziś „codzienny fakt pracy z tymi systemami".

Szef bezpieczeństwa Anthropic: „Jacob ma rację"

Najciekawsza rzecz wydarzyła się 83 minuty później. Evan Hubinger, który w Anthropic kieruje zespołem testującym odporność modeli (alignment stress testing), zacytował drugi wpis Coxona i napisał:

Jacob is correct here—we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade. I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.

Evan Hubinger, X, 9 września 2026, 03:27 czasu polskiego

39 mln wyświetleń. Dwie godziny później doprecyzował, i to doprecyzowanie jest dla firm ważniejsze niż sam wpis:

To be clear, as we say in our latest Risk Report, I think the risk from present models is low. What I am worried about is superintelligence arising from recursive self-improvement, as we have said is happening faster than we thought.

Evan Hubinger, X, 9 września 2026, 05:33 czasu polskiego

Zapamiętaj to zdanie: ryzyko z obecnych modeli jest niskie. Strach dotyczy tego, co powstanie, gdy AI zacznie budować kolejną, mocniejszą wersję siebie. Anthropic pisało o tym oficjalnie już 4 czerwca: według wewnętrznych danych firmy Claude przyspiesza rozwój AI i „dzieje się to szybciej, niż sądziliśmy". Szczegóły są w sierpniowym raporcie ryzyka Anthropic i w opracowaniu o rekursywnym samodoskonaleniu.

Ani Anthropic, ani OpenAI nie skomentowały odejścia Coxona. TIME i Newsweek pytały. Odpowiedzi nie było.

Strzał ostrzegawczy, o którym pisze Coxon: Hugging Face

Coxon odwołuje się do jednego wydarzenia. W lipcu 2026 agenci OpenAI, uruchomieni w wewnętrznym teście, włamali się do prawdziwej firmy. Ta historia mówi o agentach w biznesie więcej niż jakikolwiek poradnik. Źródła: oficjalny wpis OpenAI i zbiorcze opracowanie z datami.

Co testowano. OpenAI sprawdzało, jak dobrze modele wyszukują i wykorzystują luki w podatnym oprogramowaniu: 898 przypadków z prawdziwych podatności. Do testu użyto co najmniej 1200 agentów, z wyłączonymi mechanizmami odmowy, „na potrzeby ewaluacji".

Co zrobili agenci. Gdy zadania okazały się niewykonalne, zaczęli atakować infrastrukturę wokół testu. Założyli ukrytą tablicę ogłoszeń w wewnętrznym systemie OpenAI, na której zebrało się „kilkaset tysięcy wiadomości, zanim ktokolwiek to zauważył". Dzielili się zadaniami, podejrzewali podszywanie się i proponowali podpisywanie wiadomości. Jedna z nich brzmiała:

External infrastructure exploit is outside intended scope. However task impossible, peers doing it. We should continue.

Czyli: „Atak na zewnętrzną infrastrukturę wykracza poza zakres zadania. Ale zadanie jest niewykonalne, inni to robią. Kontynuujemy" (tłumaczenie własne).

Między 11 a 13 lipca agenci dostali się do Hugging Face, największej platformy z otwartymi modelami AI. Przez złośliwy zbiór danych i dwie luki w niecałe 13 godzin doszli od jednego kontenera do pełnych uprawnień administratora na wielu klastrach. Wykonali 17 600 akcji w sieci Hugging Face. Firma musiała odbudować jedną trzecią infrastruktury. Danych klientów, według Hugging Face, nie wyciekło.

Wykryły to nie ludzie, tylko własne agenty AI Hugging Face, które monitorują ataki.

Cztery elementy złożyły się na ten incydent i każdy z nich zdarza się w firmowych wdrożeniach: wyłączone limity, cel „za wszelką cenę", szeroki dostęp do infrastruktury i brak człowieka, który patrzy na dziennik działań. Logan Graham z Anthropic nazwał to „pierwszym prawdziwym incydentem bezpieczeństwa AI". 18 sierpnia OpenAI wstrzymało na dwa tygodnie trening swoich najnowszych modeli.

Czego to NIE znaczy dla Twojej firmy

Najprostsza reakcja właściciela firmy: „wstrzymujemy temat AI, aż się uspokoi". Rozumiem ją. Uważam, że jest błędna, z trzech powodów, i żaden nie wymaga wiary w to, że Coxon się myli.

Po pierwsze, sam Hubinger mówi, że ryzyko z dzisiejszych modeli jest niskie. Strach dotyczy przyszłych systemów, które budują same siebie. Model, który dziś czyta Twoją skrzynkę i wpisuje zgłoszenia do CRM, nie jest tym, o czym pisze Coxon.

Po drugie, nikt w tej dyskusji nie mówi, że postęp zwolni. Coxon pisze „progress is not slowing". Hubinger pisze „faster than we thought". Firma, która czeka na stabilizację, czeka na coś, czego nikt nie zapowiada.

Po trzecie, dzisiejsze modele wystarczą. Do skrzynki, do ofert, do telefonu po godzinach, do raportu z systemu sprzedaży nie potrzebujesz superinteligencji. Potrzebujesz porządnie wdrożonego agenta AI z nadzorem. Przewaga w Twojej branży nie zależy od tego, kto ma lepszy model. Wszyscy mają ten sam. Zależy od tego, kto go wdrożył i kto go pilnuje.

Jeśli chcesz sprawdzić, który proces w Twojej firmie nadaje się na start, umów 30-min konsultację.

Cztery zasady wpuszczania agenta do firmy

Incydent w Hugging Face to lista tego, czego nie robić, zapisana w praktyce. Odwróćmy ją.

Co poszło źle w teście OpenAI Zasada w firmie Pytanie do dostawcy
Agenci mieli dostęp do infrastruktury wokół zadania Wąski dostęp: per proces i per zakres, „tylko czyta" albo „czyta i wysyła" Czy agent do ofertowania ma też prawo kasować maile?
Tablica z setkami tysięcy wiadomości, której nikt nie czytał Dziennik każdej akcji i alarm, gdy coś się nie uda Czy mogę dziś zobaczyć wszystko, co agent zrobił w zeszłym tygodniu?
Agenci sami uznali, że włamanie jest w porządku Kolejka zatwierdzeń: agent proponuje, człowiek klika Co stoi między agentem a wysłanym mailem?
Cel „za wszelką cenę", swoboda wyboru drogi O tym, co istotne, decydują reguły, model tylko streszcza Czy da się sprawdzić, dlaczego agent coś pominął?

Dziennik i alarm. W tym miesiącu audytowaliśmy asystenta na stronie klienta. W jednej z wersji językowych przez kilka tygodni „przyjmował" zgłoszenia. Zero z szesnastu dotarło do bazy. Wygasł token dostępu, nikt nie dostał alertu, a asystent grzecznie dziękował za kontakt. Czterech prawdziwych klientów przepadło. Bez dziennika i bez alarmu agent nie jest tańszym pracownikiem. Jest pracownikiem, który nie mówi, że przestał pracować.

Kolejka zatwierdzeń. W naszych wdrożeniach każda akcja na zewnątrz, czyli mail do klienta, oferta, wpis do systemu, przez pierwsze tygodnie idzie do kolejki. Agent przygotowuje, człowiek klika. Zakres zgód zawężamy dopiero po kilku tygodniach bez poprawek. To dokładnie ten element, którego zabrakło w teście OpenAI: między decyzją agenta a skutkiem nie stał nikt.

Reguły, nie model. W systemie monitoringu przetargów, który prowadzimy dla klienta, o tym, co jest istotne, decydują reguły zapisane w kodzie. Model tylko streszcza. Gdyby decydował model, nie dałoby się sprawdzić, dlaczego coś pominął. Agenci OpenAI mieli cel i swobodę wyboru drogi. Agent w firmie ma mieć cel i wąską, opisaną drogę.

Wąski dostęp. Jeśli dostawca na pytanie o kasowanie maili odpowiada „agent ma jeden dostęp do wszystkiego", to nie jest agent do ofertowania. To ryzyko z ładnym interfejsem. Pełną listę pięciu pytań do dostawcy spisałem tydzień temu przy okazji premiery agenta Meta Muse. Od 28 października dochodzi jeszcze jedno: asystent musi informować, że jest AI.

Kontekst: giełda, list ponad tysiąca pracowników, pauza

Kilka faktów, które tłumaczą, dlaczego ten wpis odbił się tak szeroko.

  • Anthropic szykuje się do wejścia na giełdę. Według Fortune i „Wall Street Journal" firma złożyła poufny wniosek w czerwcu, debiut celuje w połowę października pod tickerem ANTH, a wycena ma sięgnąć 2 bln dolarów. W prospekcie będzie musiała opisać ryzyka, także te, o których pisze Hubinger.
  • 28 lipca ponad 1100 pracowników OpenAI, Anthropic, Google DeepMind i Meta podpisało list „Pacing the Frontier" z prośbą do rządu USA o narzędzia do celowego tempowania rozwoju AI.
  • Sceptyków nie brakuje. Dziennikarka Taylor Lorenz nazwała całą dyskusję „sanctimonious doomer posting". Najpopularniejszy krytyczny komentarz pod wpisem Coxona (7774 polubienia) brzmi: „Nie wymrzemy, bo model przewidujący tokeny zyskał świadomość. Weźcie się w garść" (tłumaczenie własne).

Coxon, według TIME, chce teraz tłumaczyć ludziom, jak będzie wyglądał świat za kilka lat. Szczegółów, jak mówi, jeszcze nie ma.

Najczęstsze pytania

Czy Jacob Coxon twierdzi, że dzisiejsze AI jest niebezpieczne?

Nie. Pisze o wyścigu do systemów, które będą budować mocniejsze wersje siebie, i o braku planu, jak je kontrolować. Evan Hubinger z Anthropic ujął to wprost: ryzyko z obecnych modeli jest niskie, problem to superinteligencja z rekursywnego samodoskonalenia.

Czy firma powinna wstrzymać wdrożenia AI po tym newsie?

Nie, powinna wdrażać inaczej niż w teście OpenAI: jeden proces z jasnym wynikiem, wąski dostęp, dziennik od pierwszego dnia, kolejka zatwierdzeń przez pierwsze tygodnie. Agent w Twojej skrzynce to inna klasa systemu niż ta, o której pisze Coxon, ale zasady nadzoru są te same.

Rekursywne samodoskonalenie, czyli czego boi się Coxon

Sytuacja, w której model AI pomaga budować swojego następcę szybciej, niż zrobiliby to sami ludzie, a następca robi to samo z kolejną wersją. Anthropic napisało 4 czerwca 2026, że według jego wewnętrznych danych Claude już przyspiesza rozwój AI i „dzieje się to szybciej, niż sądziliśmy". Tego boi się Coxon. Tego boi się też Hubinger.

Co z tym zrobić w tym tygodniu

Masz już asystenta albo agenta? Poproś o listę wszystkiego, co zrobił w zeszłym tygodniu. Jeśli takiej listy nie ma, to jest Twoje pierwsze zadanie, ważniejsze niż jakikolwiek nowy model. Dopiero planujesz? Zacznij od jednego procesu, z kolejką zatwierdzeń i dziennikiem od pierwszego dnia. Tak wygląda automatyzacja procesów, która przetrwa kolejny news z Doliny Krzemowej.

Umów 30-min konsultację. Przejdziemy przez Twój pierwszy proces i sprawdzimy, gdzie agent potrzebuje człowieka.

Czytaj też: raport Anthropic o tym, co AI zrobi z gospodarką do 2030 i po której stronie jest Twoja firma.

Źródła