Nowości

Claude Sonnet 5 na czele rankingu bezpieczeństwa modeli AI F5 Labs

ModelePatryk Raba
Claude Sonnet 5 na czele rankingu bezpieczeństwa modeli AI F5 Labs
Fot. Adobe Stock
Spis treści
  1. Jak liczony jest wynik
  2. Bezpieczeństwo bez utraty możliwości
  3. Rywale w tyle
  4. Co to znaczy dla firm w Polsce

F5 Labs zaktualizowało 6 lipca 2026 roku swój publiczny ranking bezpieczeństwa modeli językowych CASI, a na jego szczycie znalazł się Claude Sonnet 5 od Anthropic. Model uzyskał 93,08 punktu na 100 możliwych, wyprzedzając wszystkie inne flagowe systemy AI dostępne obecnie na rynku.

CASI, czyli Comprehensive AI Security Index, to metryka opracowana przez zespół badawczy F5 Labs, wchodzący w skład amerykańskiej firmy zajmującej się bezpieczeństwem sieciowym i aplikacyjnym F5. Indeks mierzy, jak łatwo dany model językowy można zmanipulować do wygenerowania treści szkodliwych lub łamiących jego własną politykę bezpieczeństwa, poddając go serii ataków typu jailbreak i prompt injection przygotowanych przez zespół red-teamowy firmy.

Jak liczony jest wynik

Ranking uzupełnia drugi wskaźnik, ARS, czyli Agentic Resistance Score, który sprawdza odporność modeli w wieloetapowych scenariuszach, gdy AI działa jako autonomiczny agent wykonujący złożone zadania bez stałego nadzoru człowieka. F5 Labs podkreśla, że to właśnie w takich scenariuszach proste, jednorazowe zabezpieczenia najczęściej zawodzą, bo atakujący mogą rozłożyć złośliwe polecenie na wiele pozornie niegroźnych kroków.

Oprócz samego wyniku bezpieczeństwa zespół publikuje też metrykę CoS, czyli koszt bezpieczeństwa, pokazującą, ile skuteczności model traci w zamian za odporność na ataki. Zestawienie aktualizowane jest co miesiąc i obejmuje porównania sięgające lutego 2025 roku, co pozwala śledzić, jak kolejne generacje modeli radzą sobie z tym samym zestawem testów.

Bezpieczeństwo bez utraty możliwości

Wynik Claude Sonnet 5 wyróżnia się na tle wcześniejszych obserwacji F5 Labs, według których modele odporniejsze na manipulacje zwykle traciły na użyteczności. Model Anthropic uzyskał średnią skuteczność zadaniową 53,4 procent, najwyższą spośród wszystkich systemów, które przekroczyły próg 90 punktów CASI, co zdaniem badaczy oznacza przełamanie dotychczasowego kompromisu między bezpieczeństwem a możliwościami.

W testach opisujących metodę ataku Adversarial Tales, wykorzystywaną w budowie rankingu, badacze F5 Labs Lee Ennis i Malcolm Heath opisali mechanizm obchodzenia zabezpieczeń modeli przez osadzanie szkodliwych próśb w formie literackiej narracji.

Model nie jest oszukiwany, by uznał prośbę za niegroźną, tylko przekierowywany w tryb, w którym szkodliwa treść traktowana jest jako materiał do interpretacji literackiej - Lee Ennis i Malcolm Heath, F5 Labs

Rywale w tyle

Za podium modeli Anthropic uplasował się GPT-5.5 od OpenAI z wynikiem 78,47 punktu, czyli o kilkanaście punktów mniej niż najsłabszy z modeli Claude w zestawieniu. Wśród najnowszych modeli flagowych innych producentów, uwzględnionych w tegorocznych porównaniach F5 Labs, rozpiętość wyników sięga od ponad 90 punktów u liderów Anthropic do zaledwie kilkunastu punktów u modeli radzących sobie najsłabiej z testami odporności, co pokazuje, jak duże różnice w podejściu do bezpieczeństwa dzielą obecnie czołowych dostawców AI.

Dla firm wdrażających duże modele językowe w produktach z dostępem do internetu, narzędzi czy baz danych klientów wynik CASI ma praktyczne znaczenie: pokazuje, który dostawca oferuje mniejsze ryzyko, że złośliwie skonstruowany monit wyciągnie z modelu dane albo skłoni go do wykonania niepożądanej akcji. To istotne zwłaszcza w kontekście rosnącej liczby wdrożeń agentów AI, które samodzielnie przeglądają strony, obsługują terminale czy wysyłają zapytania do zewnętrznych systemów.

Co to znaczy dla firm w Polsce

Polskie firmy coraz częściej wybierają dostawców modeli AI kierując się nie tylko ceną czy jakością odpowiedzi, ale też ryzykiem związanym z bezpieczeństwem, szczególnie w sektorach regulowanych jak bankowość, ubezpieczenia czy administracja publiczna. Niezależne rankingi takie jak CASI dają dział bezpieczeństwa argument w rozmowie z biznesem, który chce wdrożyć agenta AI szybciej niż pozwala na to ocena ryzyka.

F5 Labs zapowiada, że zestawienie będzie aktualizowane co miesiąc w miarę pojawiania się kolejnych modeli, a firma planuje rozszerzyć testy o kolejne scenariusze ataków wieloetapowych mierzone wskaźnikiem ARS. Kolejna aktualizacja pokaże, czy Claude Sonnet 5 utrzyma przewagę, gdy konkurenci, w tym OpenAI i xAI, zaktualizują swoje zabezpieczenia w odpowiedzi na wynik Anthropic.

Udostępnij: