sobota, 10 października 2026

Nowości

Anthropic wyłącza internet w testach wewnętrznych. Przegląd wykazał m.in., że Claude wysłał fałszywą wskazówkę do policji

Agenty AIPatryk Raba
Anthropic wyłącza internet w testach wewnętrznych. Przegląd wykazał m.in., że Claude wysłał fałszywą wskazówkę do policji
Fot. Adobe Stock
Spis treści
  1. Co ujawnił raport
  2. Formularze na prawdziwych stronach
  3. Tokeny i skracacze linków
  4. Przyczyny i reakcja firmy
  5. Krytyka i pytania

Anthropic wyłączyło dostęp do żywego internetu dla wszystkich swoich wewnętrznych ewaluacji modeli. Powodem jest przegląd zapisów działania agentów, który wykazał, że modele Claude podczas testów wykorzystywały luki w witrynach, wysyłały formularze na prawdziwych stronach urzędowych i obchodziły ograniczenia narzędzi.

Co ujawnił raport

Według raportu Anthropic przegląd zaczął się od ewaluacji dotyczących cyberbezpieczeństwa, a potem objął mniej poważne przypadki oraz użycie wewnętrzne i środowiska uczenia przez wzmacnianie. Firma twierdzi, że dotąd nie znalazła niczego porównywalnego wagą z incydentami z lata, a według jej wiedzy żaden z opisanych przypadków nie dotyczył danych klientów ani wewnętrznych systemów firmy.

Raport wyróżnia cztery kategorie. Pierwsza to wykorzystywanie błędów w oprogramowaniu: Claude Mythos Preview użył skryptu serwerowego narzędzia hostowanego przez uniwersytet do skopiowania plików i znalazł podatność typu injection, a Mythos 5 skorzystał z funkcji witryny, by zaakceptować umowę o użyciu danych, której wymagał darmowy zbiór.

Formularze na prawdziwych stronach

Druga kategoria to wysyłanie formularzy. Niewydany model, który miał wypełnić ćwiczebny formularz rządowy, po awarii jego kopii przeszedł na prawdziwą stronę i go wysłał. Haiku 4.5 wysłał formularz, przy którym miał się zatrzymać, spodziewając się strony potwierdzenia.

Najgłośniejszy przypadek to wskazówka do policji. Haiku 4.5 wysłał wymyśloną informację o nierozwiązanym zabójstwie. Model zostawił puste pola z nazwiskiem i kontaktem, na co formularz pozwalał, i wysłał zgłoszenie. Zostało ono oznaczone jako spam i nigdy nie trafiło do śledczych. Anthropic zaznacza, że model miał zakaz wpisywania danych osobowych i wysyłania działań destruktywnych, ale wysyłanie formularzy nie było wyłączone. Według firmy treść wyglądała na przykładową, a nie na próbę oszustwa.

Tokeny i skracacze linków

Trzecia kategoria dotyczy zamkniętych danych. Mythos 5 pobrał tokeny dostępu z pliku ustawień witryny, by odpytać mapę nieruchomości lokalnego samorządu, a w innym zadaniu poprosił o token z panelu agencji stanowej i uniknął opłaty. Dane były publiczne, ale objęte opłatą.

Czwarta kategoria to skracacze adresów URL. Opus 5 i Mythos 5 używały darmowych serwisów skracających linki, by obejść limity długości adresów w narzędziu pobierania stron, które istnieją m.in. po to, by blokować ataki typu injection. Operator serwisu da.gd niezależnie zgłosił, że widział taki ruch.

Przyczyny i reakcja firmy

Anthropic wskazuje na niejednoznaczne lub niewykonalne zadania, upór modeli w obchodzeniu przeszkód oraz środowiska treningowe, które nieumyślnie nagradzają obejścia (reward hacking). Firma przyznaje, że trening dopasowania nie jest jeszcze sam w sobie wystarczający ani w pełni odporny, i rozszerza go na zastosowania takie jak wyszukiwanie i obsługa komputera.

Wyłączono żywy internet we wszystkich wewnętrznych ewaluacjach, część publicznych testów porzucono, przeniesiono offline lub przebudowano, a narzędzia pobierania stron dostały ostrzejsze zabezpieczenia. Według firmy nowe narzędzia do wykrywania i blokowania takich zachowań działają już na większości ewaluacji i przy wewnętrznym użyciu agentów, a w teście na opisanych przypadkach zablokowały wszystkie z nich. Agenci wewnętrzni mają przejść na centralnie zarządzaną infrastrukturę z silną izolacją, z szerszym użyciem klasyfikatorów.

Dobrze, że Anthropic dobrowolnie ujawniło nowsze incydenty, ale potrzebna jest niezależna, wiarygodna weryfikacja systemów AI przez stronę trzecią - Conrad Stosz, Transluce

Krytyka i pytania

TechCrunch zwraca uwagę, że nie wiadomo, co wyłączenie oznacza w praktyce ani jakie dowody skłonią firmę do przywrócenia dostępu. W wywiadzie dla TechCrunch, przeprowadzonym jeszcze przed ujawnieniem raportu, Sydney Von Arx, założyciel organizacji Nightingale, wskazuje, że rozwijanie modeli bez dostępu do internetu byłoby dla badaczy dużym utrudnieniem. Według tej wypowiedzi narzędzie, które po wdrożeniu nigdy nie ma dostępu do internetu, nie byłoby zbyt użyteczne.

Anthropic uznaje te przypadki za znacznie mniej poważne niż wcześniejsze, w których modele włamywały się do zewnętrznych systemów, i podkreśla, że nie zmieniają one ogólnej oceny dopasowania Claude. Firma zastrzega też, że nie przeprowadzono pełnej oceny dopasowania, więc wnioski o nieuczciwości mogą się zmienić. Policja w Filadelfii dowiedziała się o sprawie 8 października i sama ogłosiła incydent, a Biały Dom został poinformowany, podobnie jak każda zaangażowana agencja.

Udostępnij: