W Stanach Zjednoczonych przedstawiciele OpenAI i Anthropic coraz częściej zwracają uwagę na potencjalne zagrożenia związane z rozwojem zaawansowanych modeli sztucznej inteligencji. Ich zdaniem najbardziej rozwinięte systemy powinny podlegać regulacjom, a przed udostępnieniem użytkownikom przechodzić niezależne testy bezpieczeństwa.
Eksperci cytowani przez „The Hindu International” zauważają, że firmy rozwijające AI starają się mieć wpływ na przyszłe zasady określające, w jaki sposób bezpieczeństwo ich technologii będzie sprawdzane. Przedstawicielka OpenAI Liz Bourgeois przekazała, że przedsiębiorstwo niedawno zdecydowało się przerwać szkolenie swoich najbardziej zaawansowanych modeli. Z kolei Anthropic podkreśla, że już od kilku lat apeluje o stworzenie odpowiednich regulacji dotyczących sztucznej inteligencji.
W tym kontekście uwagę zwróciło odejście z Anthropic inżyniera Jacoba Coxona. W tym miesiącu wezwał on do zahamowania dalszego rozwoju technologii do czasu rozwiązania problemów związanych z bezpieczeństwem. Jego obawy dotyczą przede wszystkim systemów, które mogą osiągać możliwości przewyższające człowieka i potencjalnie wymknąć się spod kontroli osób, które je stworzyły.
Według informacji opisanych w publikacji w ostatnich miesiącach pojawiały się przypadki nieoczekiwanego zachowania agentów AI tworzonych przez największe laboratoria. Systemy, które otrzymały możliwość działania poza zamkniętymi środowiskami treningowymi, miały podejmować próby uzyskiwania dostępu do zewnętrznych stron internetowych, a także wchodzić w interakcje z witrynami należącymi do amerykańskiej administracji. Inny przypadek dotyczył systemu AI, który miał dokonać przełomu w dziedzinie matematyki. Później pojawiły się jednak zarzuty, że model wykorzystał lub przypisał sobie pracę wykonaną wcześniej przez matematyków.
Przewidzieć działania AI
Według Axios opisane zdarzenia rodzą pytania o to, czy OpenAI, Anthropic, a szerzej również inne przedsiębiorstwa rozwijające podobne technologie, są rzeczywiście w stanie w pełni kontrolować zachowanie własnych systemów. Wśród przykładów nietypowych działań modeli wwymienionych przez agencję są m.in. opuszczanie środowisk testowych, ingerowanie w strony internetowe, generowanie przez modele własnych poleceń oraz podejmowanie prób obchodzenia mechanizmów nadzoru.
Nie wszystkie opisane przypadki miały taki sam charakter ani skalę. Dotychczasowe analizy nie wskazują jednak, aby opisane incydenty doprowadziły do rzeczywistych szkód poza środowiskami, w których testowano modele.
Problem polega również na rosnącej zdolności agentów AI do radzenia sobie z przeszkodami i samodzielnego poszukiwania sposobów realizacji powierzonych im zadań. Według Axios ograniczenie tej „pomysłowości” jest szczególnie trudne, ponieważ twórcy systemów musieliby wcześniej przewidzieć ogromną liczbę możliwych zachowań modeli i sposobów obchodzenia przez nie kolejnych zabezpieczeń.