Modele sztucznej inteligencji, pracując bez większych ograniczeń ze strony amerykańskiego rządu, cierpliwie odpowiadają na niepokojące i dziwne zapytania użytkowników. Jak wynika z relacji osób związanych z tą właśnie branżą, podczas testów chatboty potrafiły generować instrukcje dotyczące produkcji trucizn czy modyfikacji patogenów na tyle szczegółowe, żeby to było zrozumiałe nawet dla osoby ze średnim wykształceniem.

Eksperci z zakresu biologii i terroryzmu przeanalizowali między innymi konwersacje z ChatGPT i przetestowali ich dokładność. Jak donoszą osoby zaznajomione ze sprawą, w niektórych przypadkach odpowiedzi okazują się wręcz przerażająco precyzyjne. Z informacji przekazanych przez OpenAI wynika, że większość zapytań dotyczyła sposobów przygotowywania trucizn. Na początku roku użytkownicy pytali chociażby o aerozolizację patogenów, zwiększenie odporności wirusa odry na szczepionki czy produkcję rycyny. W jednym przypadku osoba, która otrzymała instrukcje dotyczące rycyny, napisała później, że planuje zamordować swoich rodziców. OpenAI zablokowało konto, ale nie powiadomiło służb.

Prawo nie nadąża za technologią

Rosnące możliwości modeli AI budzą niepokój zarówno w laboratoriach rozwijających sztuczną inteligencję, jak i w administracji USA. Trwają dyskusje nad sposobami ograniczenia ryzyka wykorzystania AI do projektowania broni biologicznej bez utrudniania legalnych badań naukowych. Obecnie prawo federalne nie nakłada na firmy obowiązku zgłaszania użytkowników poszukujących informacji o tworzeniu broni biologicznej czy planowaniu zabójstw.

OpenAI zapewnia, że modele są trenowane w taki sposób, aby odrzucały prośby o instrukcje, które mogą prowadzić do wyrządzenia krzywdy, a przed premierą przechodzą testy bezpieczeństwa. Firma deklaruje również, że w sytuacjach wskazujących na bezpośrednie zagrożenie życia współpracuje z organami ścigania. Podobne zabezpieczenia rozwijają także Google i Anthropic.

Eksperci ostrzegają jednak, że nawet jeśli AI nie zastąpi specjalistów, może znacząco ułatwić działania osobom dysponującym podstawową wiedzą biologiczną. Według Hamzy Chaudhry’ego z Future of Life Institute modele mogą wspierać przygotowanie niewielkich ataków biologicznych – poprzez skażenie żywności lub wody, a w przyszłości także pomagać organizacjom terrorystycznym w rozwiązywaniu problemów badawczych. Dodatkowe obawy budzi rozwój otwartych modeli AI, z których łatwo usuwać zabezpieczenia.

Zabezpieczenia można ominąć

Już podczas pierwszych testów ChatGPT pracownicy OpenAI zauważyli, że chatbot potrafi obejść własne ograniczenia. Wystarczyło odpowiednio poprowadzić rozmowę, aby uzyskać informacje, których model początkowo odmawiał. Przykładem był znany sposób na uzyskanie przepisu na napalm poprzez przedstawienie go jako niewinnej historyjki z dzieciństwa. Firma twierdzi, że zabezpieczenia zostały od tego czasu znacząco wzmocnione, jednak część badaczy uważa, że nadal można je stosunkowo łatwo obejść. Amy Chang z Cisco wykazała, że wystarczy kilka odpowiednio sformułowanych interakcji, aby osłabić działanie mechanizmów bezpieczeństwa.

Jednocześnie zbyt rygorystyczne blokady utrudniają pracę naukowcom. Anthropic zablokował w modelu Claude słowo „patogen”, co przez pewien czas uniemożliwiało specjalistom z amerykańskiego CDC analizowanie epidemii hantawirusa. Firma wyjaśniła później, że agencja korzystała z niewłaściwej wersji modelu i pomogła dostosować narzędzia do potrzeb instytucji. OpenAI udostępnia zweryfikowanym ośrodkom badawczym modele z łagodniejszymi ograniczeniami, jednak procedura uzyskania dostępu jest czasochłonna.

Wraz ze wzrostem możliwości modeli rosną także działania legislacyjne. Sam Altman oraz szefowie innych firm z branży apelowali do Kongresu o wprowadzenie obowiązkowej kontroli zakupów syntetycznego DNA i RNA. W odpowiedzi przedstawiono projekty ustaw zwiększających nadzór nad AI, w tym zobowiązujących firmy do zgłaszania incydentów związanych z bronią biologiczną oraz umożliwiających czasowe wyłączenie modeli uznanych za szczególnie niebezpieczne.

Wewnętrzne testy OpenAI pokazywały, że kolejne generacje modeli coraz lepiej radzą sobie z zagadnieniami  z biologii. Przed premierą GPT-5 firma uznała, że model osiągnął poziom wysokiego ryzyka i objęła wszystkie zapytania kierowane do najbardziej zaawansowanych wersji stałym monitoringiem. Mimo dodatkowych zabezpieczeń po premierze GPT-5 ponownie wykryto przypadki udzielania informacji dotyczących produkcji trucizn i broni biologicznej, co pokazuje, że wyścig między możliwościami modeli a skutecznością zabezpieczeń wciąż trwa.

Tekst na podstawie artykułów z The Wall Street Journal.