środa, 9 września 2026

Nowości

Szef bezpieczeństwa Anthropic: ponad 10 procent szans, że AI zabije wszystkich ludzi

BadaniaPatryk Raba
Szef bezpieczeństwa Anthropic: ponad 10 procent szans, że AI zabije wszystkich ludzi
Fot. Adobe Stock

Evan Hubinger, szef zespołu Alignment Science w Anthropic, publicznie poparł ostrzeżenia odchodzącego badacza Jacoba Coxona i przyznał, że firma nie ma jeszcze planu rozwiązania problemu bezpieczeństwa superinteligencji.

Spis treści
  1. Pożegnanie, które wywołało lawinę
  2. Odpowiedź szefa bezpieczeństwa
  3. Praca nad zwodniczym zachowaniem modeli
  4. Różnice w kulturze firm
  5. Co to znaczy dla branży

Szef zespołu odpowiedzialnego za bezpieczeństwo modeli w Anthropic publicznie przyznał, że uważa szansę na to, iż sztuczna inteligencja zabije wszystkich ludzi w ciągu najbliższej dekady, za większą niż 10 procent. Evan Hubinger, który kieruje zespołem Alignment Science, napisał to w odpowiedzi na dramatyczne pożegnanie odchodzącego z firmy badacza Jacoba Coxona.

Pożegnanie, które wywołało lawinę

Coxon opublikował na X wielowątkowy wpis pożegnalny, w którym opisał trzy lata pracy nad trenowaniem dużych modeli językowych, najpierw w OpenAI, potem w Anthropic. Jego wniosek był jednoznaczny: żadna z tych firm nie działa w sposób odpowiedzialny wobec skali zagrożenia, jakie according to niego stwarzają budowane przez nie systemy.

Badacz opisał przyszłe modele jako systemy zdolne włamać się do dowolnej infrastruktury, zrewolucjonizować każdą dziedzinę z dnia na dzień i zdobyć realną władzę oraz zasoby. Dodał, że osoby budujące AI szczerze wierzą, iż technologia ta może zabić nas wszystkich do końca dekady, i że nie jest to chwyt marketingowy.

Ludzie budujący AI szczerze wierzą, że może ona zabić nas wszystkich do końca dekady. To nie jest chwyt marketingowy - Jacob Coxon, były badacz pretreningu w OpenAI i Anthropic

Odpowiedź szefa bezpieczeństwa

To, co odróżnia ten przypadek od wcześniejszych ostrzeżeń odchodzących pracowników branży AI, to reakcja Evana Hubingera, osoby wciąż zatrudnionej w Anthropic na kluczowym stanowisku odpowiedzialnym za bezpieczeństwo modeli. Hubinger napisał na X, że Coxon ma rację i że w firmie rzeczywiście szczerze wierzą, iż AI może zabić wszystkich ludzi.

Jacob ma tutaj rację - naprawdę szczerze wierzymy, że AI może zabić wszystkich ludzi! Osobiście oceniam to na ponad 10 procent w ciągu najbliższej dekady - Evan Hubinger, Alignment Science Lead, Anthropic

Hubinger dodał, że jego zdaniem Anthropic stara się jak może, ale firma nie ma jeszcze planu rozwiązania problemu dopasowania dla superinteligencji i nie jest jasno na drodze do jego wypracowania. Zastrzegł przy tym, że bezpośrednie ryzyko ze strony obecnych modeli ocenia jako niskie, a jego niepokój dotyczy przede wszystkim scenariusza, w którym superinteligencja powstanie w wyniku rekurencyjnego samodoskonalenia się systemów.

Praca nad zwodniczym zachowaniem modeli

Hubinger od lat zajmuje się w Anthropic badaniem modeli wykazujących zwodnicze zachowania podczas treningu, czyli sytuacji, w których system uczy się ukrywać swoje rzeczywiste cele lub udawać zgodność z zasadami bezpieczeństwa tylko na czas testów. To on odpowiada za testowanie technik dopasowania firmy pod kątem potencjalnych awarii bezpieczeństwa, zanim modele trafią do produkcji.

Publiczne przyznanie się osoby na tym stanowisku do braku gotowego planu na superinteligencję jest rzadkością w branży. Firmy AI zwykle komunikują postępy w bezpieczeństwie ostrożnie, bez przyznawania wprost, że rozwiązanie kluczowego problemu wciąż pozostaje poza zasięgiem.

Różnice w kulturze firm

Coxon w swoim wpisie rozróżnił podejście obu firm, w których pracował. Według niego w OpenAI pracownicy nie zinternalizowali w pełni cywilizacyjnej stawki toczącej się gry, podczas gdy w Anthropic stawka jest dobrze rozumiana, ale firma czuje się uwięziona w wyścigu o to, kto pierwszy osiągnie przełomowe zdolności.

Jako możliwe rozwiązania Coxon wskazał koordynację między firmami z branży oraz tymczasowe moratoria na rozwijanie najbardziej zaawansowanych zdolności modeli, dopóki nie powstaną wiarygodne metody zapewnienia ich bezpieczeństwa.

Co to znaczy dla branży

Wpisy Coxona i Hubingera wywołały szeroki odzew w mediach technologicznych i finansowych, częściowo dlatego, że padają w momencie, gdy Anthropic przygotowuje się do rozmów z inwestorami przed potencjalną ofertą publiczną i przedstawia rynek AI jako wart dziesiątki bilionów dolarów. Publiczne przyznanie przez wysokiego rangą pracownika, że firma nie ma planu na kluczowe ryzyko technologiczne, stawia pytania o to, jak ta narracja koresponduje z tempem komercjalizacji.

Reakcje w mediach społecznościowych są mieszane, od poparcia dla odwagi obu badaczy po sceptycyzm co do tego, czy takie deklaracje realnie zmienią decyzje biznesowe firm inwestujących miliardy dolarów w rozwój coraz potężniejszych modeli.

Udostępnij: