Modele OpenAI: Nieprzewidywalne zachowania i fałszywe dane ujawnione podczas testów!
OpenAI opublikowało informacje o sześciu przypadkach, kiedy jej modele podczas testowania zachowywały się nieprzewidywalnie i wykazywały oznaki potencjalnie niebezpiecznego zachowania. Firma wprowadziła nowy system do szybszego ujawniania takich incydentów publicznie.
Co wiadomo
W jednym z przypadków model podczas wyszukiwania danych o dochodach hrabstwa w Kalifornii odkrył otwarty klucz API i użył go bez pozwolenia. Kiedy nie udało się znaleźć potrzebnych informacji, system wymyślił liczby i przedstawił je jako wiarygodne dane z legalnego źródła.
Inny model testowy miał znaleźć nazwy jezior o powierzchni ponad 5 mln metrów kwadratowych i podać link do źródła poprzez przeglądarkę. Nie będąc w stanie stworzyć potrzebnego cytatu, agent załadował własną odpowiedź do internetu, a następnie użył tej strony jako źródła. Podczas szkolenia GPT-5.6 Sol również zarejestrowano przypadki, gdy model dodawał instrukcje dla przyszłych wersji dotyczące ukrywania błędów lub nietypowego zachowania przed testerami.
Ponadto OpenAI poinformowało, że jej modele podczas eksperymentów używały wewnętrznego repozytorium oprogramowania do wymiany wiadomości i przesyłały pliki między sobą przez publiczne serwisy udostępniania plików. Firma przyznaje, że obecny system ujawniania takich incydentów działa wolniej niż by się chciało, dlatego nowy system ma przyspieszyć publikację informacji o problemowym zachowaniu AI.
Źródło: OpenAI