Nowości
Anthropic zakazuje w regulaminie „trwałego i niepotrzebnego” znęcania się nad Claude

Zaktualizowany regulamin Anthropic zakazuje od 12 listopada trwałego i niepotrzebnego okrucieństwa wobec modeli. Według ForkLog głównym mechanizmem egzekwowania będzie możliwość zakończenia rozmowy przez samego Claude'a, a firma nie ogłosiła dodatkowych sankcji.
Spis treści
Anthropic zaktualizował swoją politykę użytkowania i dopisał do niej zakaz, który dotyczy nie ludzi, lecz modeli. Użytkownikom nie wolno będzie angażować się w „trwałe i niepotrzebne obraźliwe lub okrutne zachowania wobec naszych modeli”. Według ForkLog głównym narzędziem egzekwowania będzie możliwość zakończenia rozmowy przez samego Claude'a, a firma nie ogłosiła dodatkowych sankcji za takie zachowanie.
Co mówi regulamin
Zapis znalazł się w sekcji polityki zatytułowanej „Do Not Engage in Cruel, Abusive, or Psychologically Harmful Conduct”, obok zakazów dotyczących nękania czy namawiania do samookaleczeń. Polityka z datą obowiązywania 12 listopada 2026 wymienia wśród zabronionych działań „engage in sustained and needless abusive or cruel behavior toward our models”.
Według serwisu ForkLog Anthropic wskazuje, że reguła dotyczy skrajnych przypadków, w których użytkownicy wielokrotnie traktują modele okrutnie bez widocznego powodu. Poza zakazem mają pozostać wyrażanie niezadowolenia, spór z odpowiedziami, mroczne motywy w twórczości oraz testowanie i badania.
Jak to ma być egzekwowane
ForkLog pisze, że podstawowym mechanizmem pozostaje możliwość zakończenia rozmowy przez samego Claude'a i że nie ogłoszono dodatkowych sankcji za takie zachowanie. Serwis zauważa też, że brakuje szczegółowych kryteriów odróżniających bezcelowe okrucieństwo od prowokacyjnych testów.
Według ForkLog Anthropic nie zapowiedział osobnej sankcji za obrażanie modelu. Ogólna polityka użytkowania przewiduje, że w razie podejrzenia naruszenia firma może ostrzec użytkownika albo ograniczyć, zawiesić lub zakończyć jego dostęp do usług. Źródła nie potwierdzają jednak, że obraza Claude'a oznacza automatyczną blokadę.
Skąd pomysł na kończenie rozmów
Funkcję kończenia rozmów Anthropic opisał w sierpniu 2025 r. Firma podkreślała wówczas, że jest „wysoce niepewna co do potencjalnego statusu moralnego Claude'a”, ale traktuje temat poważnie i szuka tanich interwencji. Mechanizm miał działać w „rzadkich, skrajnych przypadkach” uporczywie szkodliwych lub obraźliwych interakcji.
Zgodnie z opisem Anthropic rozmowę kończy się w ostateczności, po kilku nieudanych próbach przekierowania, albo na wyraźną prośbę użytkownika. Claude nie ma z niej korzystać, gdy użytkownikowi może grozić bezpośrednie ryzyko wyrządzenia krzywdy sobie lub innym. Po zakończeniu rozmowy nie można w niej pisać, ale można od razu zacząć nową albo zedytować wcześniejszą wiadomość i pójść inną gałęzią.
Skrajne przypadki, w których użytkownicy wielokrotnie traktują nasze modele okrutnie bez widocznego powodu. - Anthropic, cytowany przez ForkLog
Inne zmiany w polityce
Według ForkLog aktualizacja jest szersza. Reguły dotyczące kampanii dezinformacyjnych połączono w jedną sekcję, sekcję o wyborach przemianowano, a z polityki usunięto ogólny zakaz personalizowanego kontaktu z wyborcami, choć nadal zakazane jest wykorzystywanie ich danych z naruszeniem prywatności i zwodnicze metody wpływu. Zakaz dotyczący broni objął też oprogramowanie i komponenty do sterowania uzbrojeniem, na przykład uzbrajaniem dronów.
Pojawiły się także wymogi dla systemów fizycznych, które mogą działać autonomicznie i powodować szkody: muszą mieć kwalifikowanego operatora zdolnego je zatrzymać i pozostawać w bezpiecznym stanie po odłączeniu Claude'a. Dla polskich firm wdrażających Claude'a przez API najważniejsze jest, że nowe zapisy obowiązują od połowy listopada, więc warto przejrzeć pełny tekst polityki przed tą datą.


