JAK BUDOWAĆ ODPORNE MODELE AI?

Ataki antagonistyczne na modele AI.

4 klasy zagrożeń i skuteczne metody obrony

Artykuł jest drugą częścią cyklu poświęconego bezpieczeństwu systemów sztucznej inteligencji oraz zagadnieniom związanym z adversarial machine learning. Materiał powstał na podstawie pracy dyplomowej MBA w Cyberbezpieczeństwie realizowanej w Wojskowej Akademii Technicznej i stanowi syntetyczne przedstawienie najważniejszych wniosków oraz wyników badań.  

Skoro wiemy już, że modele AI da się oszukać, pojawia się pytanie inżynierskie: jak dokładnie i ile kosztuje obrona? W tym artykule rozkładam ataki antagonistyczne na cztery klasy, pokazuję, dlaczego klasyczny „złoty standard” obrony, czyli trening antagonistyczny, nie zawsze okazuje się opłacalny i wprowadzam koncepcję lekkiej obrony przez augmentację danych. Zyskasz mapę zagrożeń i kryterium decyzyjne: kiedy warto płacić za ciężką obronę, a kiedy nie. To problem, z którym coraz częściej mierzą się organizacje wdrażające systemy sztucznej inteligencji (AI) w procesach biznesowych. 

Jakie są najważniejsze rodzaje ataków antagonistycznych?

Zanim zaprojektujemy obronę, musimy wiedzieć, przed czym się bronimy. W literaturze i w mojej pracy ataki porządkuje się w trzech wymiarach: według wiedzy atakującego, fazy ataku oraz celu. Ten podział ma bezpośrednie przełożenie na to, jakie mechanizmy ochrony i kontroli można zastosować.  

Taksonomia ataków antagonistycznych

Według wiedzy atakującego

White-box

  • pełny dostęp do modelu,
  • znajomość architektury i wag,
  • przykłady: FGSM, PGD, CW.

Black-box

  • dostęp wyłącznie przez zapytania,
  • brak wiedzy o wnętrzu modelu,
  • przykłady: Square Attack, transfer attack.

Według fazy ataku

Evasion

  • atak w fazie inferencji.

Poisoning

  • atak w fazie treningu,
  • przykłady: backdoor attacks.

Według celu

Atak celowany

  • wymuszenie konkretnej klasy docelowej.

Atak nieukierunkowany

  • doprowadzenie do dowolnej błędnej klasyfikacji.

Najgroźniejszy scenariusz to atak white-box, w którym adwersarz zna architekturę i wagi modelu, więc może wykorzystać jego gradienty. To właśnie ten najtrudniejszy przypadek badałem eksperymentalnie, ponieważ jeśli obrona działa przeciw atakom typu white-box, tym bardziej powinna poradzić sobie ze słabszym przeciwnikiem.  

Jak działają ataki na modele AI?

Ataki gradientowe wykorzystują tę samą matematykę, która służy do trenowania sieci, tylko odwrotnie. Zamiast zmieniać wagi, by zmniejszyć błąd, atakujący zmienia wejście, by błąd zmaksymalizować.  

FGSM: najszybszy atak gradientowy

FGSM (Fast Gradient Sign Method) wykonuje jeden krok w kierunku gradientu. Jest szybki, ale stosunkowo prosty.  

PGD i BIM: standard oceny odporności

BIM oraz PGD są iteracyjnymi wersjami FGSM. PGD jest dziś często traktowany jako praktyczny standard oceny odporności modeli.  

Carlini-Wagner (CW): test dla najtrudniejszych scenariuszy

Carlini-Wagner (CW) to atak optymalizacyjny poszukujący najmniejszej perturbacji zdolnej do oszukania modelu. Jest wolniejszy od innych metod, ale wyjątkowo skuteczny.  

Square Attack: atak bez dostępu do modelu

Square Attack należy do klasy black-box i działa wyłącznie poprzez zapytania, bez dostępu do gradientów modelu. 

W eksperymentach to właśnie atak CW okazał się najgroźniejszy i dlatego będzie stanowił punkt odniesienia w dalszej części serii.  

Czy trening antagonistyczny jest wart swojej ceny?

Dominującą strategią obrony jest trening antagonistyczny (Adversarial Training), sformułowany jako problem Min-Max. Podczas uczenia generowane są najgorsze możliwe perturbacje, a model uczy się odporności na nie.

Rozwiązanie jest skuteczne, ale wiąże się z wysokimi kosztami obliczeniowymi. 

Trening antagonistyczny jako złoty standard

Trening antagonistyczny (Min-Max)

  • wysoki koszt obliczeniowy,
  • generowanie ataku podczas każdej iteracji treningu,
  • wielokrotnie większe zapotrzebowanie na zasoby.

Augmentacja danych

(Jitter, RandomZero, GaussianNoise)

  • niski koszt obliczeniowy,
  • jeden przebieg treningu,
  • dodatkowa warstwa losowości na wejściu.

Koszt obliczeniowy a rzeczywista skuteczność

Problem z treningiem Min-Max jest podwójny: pochłania znaczne zasoby obliczeniowe i nie zawsze dobrze radzi sobie z atakami, których model nie napotkał podczas uczenia. W świecie ograniczonych budżetów i małych zbiorów danych stanowi to realną barierę. 

Jak zwiększyć odporność modeli AI dzięki augmentacji danych?

Alternatywa opiera się na prostym pomyśle: skoro atak white-box precyzyjnie śledzi gradient modelu, zaburzmy mu ten ślad, wprowadzając kontrolowaną losowość na wejściu. Takie podejście może skutecznie zwiększać odporność modeli AI bez kosztów charakterystycznych dla treningu antagonistycznego.  

Na czym polega lekka obrona?

W pracy zbadałem siedem metod opartych na augmentacji danych i kontrolowanym zaburzaniu danych wejściowych.  

Jitter, RandomZero i inne techniki augmentacji

  • Jitter: Dodanie losowego szumu do wybranych punktów sygnału.
  • RandomZero: Losowe zerowanie fragmentów wejścia.
  • GaussianNoise: Dodanie szumu o rozkładzie normalnym.
  • SmoothTS oraz ShuffleDef: Warianty o różnej agresywności i wpływie na dane wejściowe.

Każda z tych metod stanowi lekką warstwę przed modelem i jest praktycznie nieodczuwalna pod względem kosztów obliczeniowych w porównaniu z podejściem Min-Max.  

Jak testować bezpieczeństwo AI i unikać najczęstszych błędów?

Sama znajomość ataków nie wystarcza. Skuteczne bezpieczeństwo AI wymaga regularnego testowania odporności modeli oraz stosowania uznanych standardów.  

Co rekomendują NIST AI RMF i AI Act?

NIST AI RMF, w podkategorii MEASURE 2.7, zaleca red-teaming i ocenę odporności modeli między innymi wobec adversarial examples oraz data poisoning. 

Z kolei publikacja NIST AI 100-2 Adversarial Machine Learning: A Taxonomy and Terminology dostarcza wspólnego słownika pojęć, który warto przyjąć w organizacji, aby zespoły techniczne i osoby odpowiedzialne za ryzyko mówiły wspólnym językiem.  

Po stronie regulacyjnej art. 15 ust. 3 AI Act wymaga odporności na błędy i niespójności, natomiast ust. 5 odnosi się bezpośrednio do zagrożeń typu model evasion. W praktyce oznacza to, że odporność modeli staje się jednym z elementów bezpieczeństwa systemów AI oraz zgodności regulacyjnej.  

Trzy błędy popełniane przez organizacje

  1. Ocena odporności jednym słabym atakiem: Jeśli testujesz wyłącznie FGSM, możesz uzyskać fałszywe poczucie bezpieczeństwa. Warto uwzględnić również PGD i CW.  
  2. Bezkrytyczne traktowanie Min-Max jako jedynej drogi: Dla wielu zastosowań lekka augmentacja danych zapewnia porównywalny efekt przy znacznie niższym koszcie.  
  3. Pomijanie ataków black-box i poisoningu: Obrona zaprojektowana wyłącznie pod white-box pozostawia otwarte inne wektory ataku 

Jak podejmować decyzje o wyborze metody obrony?

Potraktuj wybór obrony jak decyzję inżyniersko-ekonomiczną. Pytanie nie brzmi „która metoda jest najlepsza?”, lecz „która daje wymaganą odporność przy akceptowalnym koszcie i bez utraty dokładności bazowej?”.  

Co oznaczają te zagrożenia dla organizacji?

Ataki antagonistyczne układają się w czytelną taksonomię, a najtrudniejszym przeciwnikiem pozostaje atak white-box wykorzystujący gradienty modelu. Klasyczny trening Min-Max broni skutecznie, ale bywa nieopłacalny. Dlatego coraz większego znaczenia nabierają lekkie metody oparte na augmentacji danych, zgodne z duchem AI Act oraz zaleceniami NIST AI RMF. Stanowią one interesującą alternatywę dla organizacji, które chcą zwiększać odporność modeli bez gwałtownego wzrostu kosztów związanych z cyberbezpieczeństwem AI.  Czy te tanie metody rzeczywiście działają?


W części 3/4 pokażę wyniki własnych eksperymentów, w których jedna prosta metoda zredukowała skuteczność najgroźniejszego ataku z −26,5 pp do −0,9 pp, ale tylko pod jednym warunkiem. Zdradzę, jakim.  

AUTOR:
Piotr Hawryło – Software Team Leader z ponad 10-letnim doświadczeniem w obszarze systemów embedded. Jest absolwentem MBA z cyberbezpieczeństwa na Wojskowej Akademii Technicznej. Brał udział w projektach z zakresu uczenia maszynowego, m.in. związanych z poszukiwaniem planet pozasłonecznych. Specjalizuje się w rozwoju oprogramowania na urządzenia wbudowane i posiada doświadczenie w zarządzaniu zespołami technicznymi.