Bezpieczeństwo modeli AI kontra realne ryzyko
Firmy z branży AI grają w kotka i myszkę: z jednej strony ścigają się w rozwijaniu możliwości swoich modeli, aby z drugiej podejmować usilne próby blokowania odpowiedzi na niebezpieczne zapytania.
Wewnętrzne testy OpenAI pokazywały, że kolejne generacje modeli coraz lepiej radzą sobie z zagadnieniami z biologii.
Modele sztucznej inteligencji, pracując bez większych ograniczeń ze strony amerykańskiego rządu, cierpliwie odpowiadają na niepokojące i dziwne zapytania użytkowników. Jak wynika z relacji osób związanych z tą właśnie branżą, podczas testów chatboty potrafiły generować instrukcje dotyczące produkcji trucizn czy modyfikacji patogenów na tyle szczegółowe, żeby to było zrozumiałe nawet dla osoby ze średnim wykształceniem.
Eksperci z zakresu biologii i terroryzmu przeanalizowali między innymi konwersacje z ChatGPT i przetestowali ich dokładność. Jak donoszą osoby zaznajomione ze sprawą, w niektórych przypadkach odpowiedzi okazują się wręcz przerażająco precyzyjne. Z informacji przekazanych przez OpenAI wynika, że większość zapytań dotyczyła sposobów przygotowywania trucizn. Na początku roku użytkownicy pytali chociażby o aerozolizację patogenów, zwiększenie odporności wirusa odry na szczepionki czy produkcję rycyny. W jednym przypadku osoba, która otrzymała instrukcje dotyczące rycyny, napisała później, że planuje zamordować swoich rodziców. OpenAI zablokowało konto, ale nie powiadomiło służb.
Prawo nie nadąża za technologią
Rosnące możliwości modeli AI budzą niepokój zarówno w laboratoriach rozwijających sztuczną inteligencję, jak i w administracji USA. Trwają dyskusje nad sposobami ograniczenia ryzyka wykorzystania AI do projektowania broni biologicznej bez utrudniania legalnych badań naukowych. Obecnie prawo federalne nie nakłada na firmy obowiązku zgłaszania użytkowników poszukujących informacji o tworzeniu broni biologicznej czy planowaniu zabójstw.
OpenAI zapewnia, że modele są trenowane w taki sposób, aby odrzucały prośby o instrukcje, które mogą prowadzić do wyrządzenia krzywdy, a przed premierą przechodzą testy bezpieczeństwa. Firma deklaruje również, że w sytuacjach wskazujących na bezpośrednie zagrożenie życia współpracuje z organami ścigania. Podobne zabezpieczenia rozwijają także Google i Anthropic.
Eksperci ostrzegają jednak, że nawet jeśli AI nie zastąpi specjalistów, może znacząco ułatwić działania osobom dysponującym podstawową wiedzą biologiczną. Według Hamzy Chaudhry’ego z Future of Life Institute modele mogą wspierać przygotowanie niewielkich ataków biologicznych – poprzez skażenie żywności lub wody, a w przyszłości także pomagać organizacjom terrorystycznym w rozwiązywaniu problemów badawczych. Dodatkowe obawy budzi rozwój otwartych modeli AI, z których łatwo usuwać zabezpieczenia.
Zabezpieczenia można ominąć
Już podczas pierwszych testów ChatGPT pracownicy OpenAI zauważyli, że chatbot potrafi obejść własne ograniczenia. Wystarczyło odpowiednio poprowadzić rozmowę, aby uzyskać informacje, których model początkowo odmawiał. Przykładem był znany sposób na uzyskanie przepisu na napalm poprzez przedstawienie go jako niewinnej historyjki z dzieciństwa. Firma twierdzi, że zabezpieczenia zostały od tego czasu znacząco wzmocnione, jednak część badaczy uważa, że nadal można je stosunkowo łatwo obejść. Amy Chang z Cisco wykazała, że wystarczy kilka odpowiednio sformułowanych interakcji, aby osłabić działanie mechanizmów bezpieczeństwa.
Jednocześnie zbyt rygorystyczne blokady utrudniają pracę naukowcom. Anthropic zablokował w modelu Claude słowo „patogen”, co przez pewien czas uniemożliwiało specjalistom z amerykańskiego CDC analizowanie epidemii hantawirusa. Firma wyjaśniła później, że agencja korzystała z niewłaściwej wersji modelu i pomogła dostosować narzędzia do potrzeb instytucji. OpenAI udostępnia zweryfikowanym ośrodkom badawczym modele z łagodniejszymi ograniczeniami, jednak procedura uzyskania dostępu jest czasochłonna.
Wraz ze wzrostem możliwości modeli rosną także działania legislacyjne. Sam Altman oraz szefowie innych firm z branży apelowali do Kongresu o wprowadzenie obowiązkowej kontroli zakupów syntetycznego DNA i RNA. W odpowiedzi przedstawiono projekty ustaw zwiększających nadzór nad AI, w tym zobowiązujących firmy do zgłaszania incydentów związanych z bronią biologiczną oraz umożliwiających czasowe wyłączenie modeli uznanych za szczególnie niebezpieczne.
Wewnętrzne testy OpenAI pokazywały, że kolejne generacje modeli coraz lepiej radzą sobie z zagadnieniami z biologii. Przed premierą GPT-5 firma uznała, że model osiągnął poziom wysokiego ryzyka i objęła wszystkie zapytania kierowane do najbardziej zaawansowanych wersji stałym monitoringiem. Mimo dodatkowych zabezpieczeń po premierze GPT-5 ponownie wykryto przypadki udzielania informacji dotyczących produkcji trucizn i broni biologicznej, co pokazuje, że wyścig między możliwościami modeli a skutecznością zabezpieczeń wciąż trwa.
Tekst na podstawie artykułów z The Wall Street Journal.
Podobne artykuły
Nauka latania z AI
Poziom Fly – to najbardziej zaawansowany poziom, w którym AI w sposób ciągły adaptuje i optymalizuje decyzje Customer Experience w czasie rzeczywistym. O tym jakie branże i w jakich krajach osiągnęły ten etap, mówi raport Liveops 2026 AI Maturity Benchmark.
Koniec marzeń o łatwym startupie
SaaSpocalypse, termin opisujący kryzys i głębokie tąpnięcie na rynku oprogramowania sprzedawanego w modelu subskrypcyjnym, coraz częściej pojawia się w dyskusjach branżowych i rozmowach prowadzonych w funduszach venture capital.
TLT Summit 2026: rok sztucznej inteligencji w biznesie
Koniec ery bezrefleksyjnego zachwytu nad sztuczną inteligencją. Tegoroczna konferencja Technology Leader of Tomorrow jasno pokazała, że biznes wkracza w fazę twardego rozliczania projektów AI z efektów i kosztów
