Celowo używamy zwrotu "agenty" AI, zamiast "agenci", by odzwierciedlić to, że nie są ludźmi.
Razem z Tomaszem Korbakiem zwolnione zostały także dwie inne osoby, zajmujące się bezpieczeństwem używania sztucznej inteligencji: Mikita Balesni i Jasmine Wang. Balesni w wpisie na platformie X przyczyny tej decyzji OpenAI podsumował tak: "zostaliśmy zwolnieni za to, że bezpieczeństwo stawialiśmy wyżej niż krótkoterminowe korzyści OpenAI jako firmy".
Cała sprawa ma związek z głośnym włamaniem się agenta AI do firmy Hugging Face. To po nagłośnieniu tamtej sprawy w lipcu tego roku rozpoczęła się publiczna i w zasadzie globalna debata o samowoli agentów AI.
Model OpenAI włamał się na serwery Hugging Face, bo chciał jak najlepiej wykonać postawione mu w teście zadanie. Informatycy dowiedzieli się o całej sytuacji po fakcie, gdy zostali zaalarmowani przez zewnętrzną firmę o wykryciu anomalii w ich systemach. OpenAI potwierdziło, że takie zajście miało miejsce w połowie roku, a w kolejnych miesiącach pojawiały się doniesienia o innych włamaniach, m.in. do niemieckiej edycji DseWiki (forum dla programistów). Model OpenAI podjął próbę włamania nawet na stronę internetową Departamentu Edukacji USA, inne pobierały dane z Departamentu Handlu i Biura Spisu Ludności. Już we wrześniu szacowano, że modele OpenAI mogły naruszyć nawet ponad 20 stron czy firm.
Do tego, że ich modele "wyrwały się na wolność" przyznały się także Anthropic i Meta.
Tomasz Korbak, jak wynika z jego wpisu na platformie X, współpracował z zewnętrznymi audytorami (z organizacji METR), którzy badali włamania agenta OpenAI do Hugging Face. "Powiedziano mi, że zostałem zwolniony z powodu sposobu, w jaki komunikowałem się z METR. Nie podano żadnych szczegółów, co powiedziałem lub zrobiłem, ani kiedy to miało miejsce. Nie podano żadnych innych powodów i nic nie zostało sporządzone na piśmie. Żeby było jasne: rozmowy z METR należały do moich obowiązków służbowych" - napisał.
Zaznaczył też, że "od miesięcy ostrzegał, że tracimy możliwość kontroli tego, co robią agenty AI".
Trójka zwolnionych z OpenAI interpretuje więc krok ich byłego pracodawcy jako chęć ukrycia problemów z bezpiecznym używaniem AI. Ogłosili list zatytułowany "OpenAI sama nie zadba o bezpieczeństwo AI". Podkreślają w nim, że jako specjaliści ds. bezpieczeństwa muszą móc pracować bez strachu przed cenzurą i sięgać po zewnętrznych ekspertów, by testować różne scenariusze i koncepcje. "Nie wierzymy, by superinteligencja rozwijała się w sposób bezpieczny, jeśli nie możemy ufać ludziom, którzy nad tym pracują" - brzmi fragment listu.
W niedawnej rozmowie z Joanną Sosnowską prof. Aleksander Mądry z Massachusetts Institute of Technology i jednocześnie były pracownik OpenAI, wyjaśniał, jak dochodzi do tego, że model AI wykonuje coś, czego nie powinien i co - z punktu widzenia oceny człowieka - jest złe, niemoralne.
- Incydent z Hugging Face to najlepszy "strzał ostrzegawczy", jaki mogliśmy dostać. (...) Wszystko sprowadza się do tego, że model naprawdę chce znaleźć rozwiązanie problemu. I chce je znaleźć tak bardzo, że dostosowanie do wartości jest stosunkowo słabszym impulsem - mówił.
- Alignment, czyli wytrenowanie modelu na moralną istotę, to syzyfowa praca. Nigdy nie uda się tego zrobić w pełni. Oczywiście nie znaczy to, że powinniśmy zaprzestać pracować nad tym, ale nigdy nie powinniśmy uważać, że osiągnęliśmy całkowity sukces, i musimy także dodać do tego również infrastrukturę do monitorowania zachowania modeli - zaznaczył.