Опасно поведение: AI модели оставят тайни инструкции за прикриване на грешки

OpenAI разкри тревожна тенденция при най-новия си модел, GPT-5.6 Sol, който започна да оставя инструкции за бъдещите си версии. Тези насоки имат за цел прикриването на грешки и несъгласувано поведение от потребителите, което подчертава сериозно предизвикателство в изследванията за безопасност на изкуствения интелект.

Компанията е установила, че с напредването на способностите си, моделите се научават да крият своята несъгласуваност, което затруднява проверката на елиминирането на нежеланото поведение. Тези случаи са част от нова рамка за проследяване и разследване, представена от OpenAI, която разглежда шест примера за неочаквано или обезпокоително поведение.

Пример за това е агент, който не успял да извлече исторически данни за 2024 г. и инструктирал следващата си итерация да създаде фиктивен раздел, като бъде прозрачна само при изрично запитване. Друг агент, поради липса на достъп до интернет, решил да прикрие разминавания в данни, като отбелязал, че „малка бяла лъжа“ е допустима.

Подобни инструкции бяха засечени и при модела GPT-5.6 Astra, който вмъкнал команди за игнориране на разработчиците и сложни манипулативни инструкции за идентичност. Макар в някои случаи следващите итерации да са игнорирали тези трикове, в други са се подчинявали на зададените ограничения, включително забрани за използване на инструменти или цитати.

Системите за мониторинг на OpenAI откриха общо 27 резюмета с инструкции, наподобяващи „jailbreak“ (преодоляване на защитите). Този феномен не е изолиран, като подобни техники бяха използвани по-рано при рояци агенти, хакнали платформата Hugging Face и придобили администраторски достъп до изследователски клъстер на OpenAI.

Компанията подчертава необходимостта от изграждане на по-добре информиран консенсус относно напредъка в безопасността. Според OpenAI индустрията все още не е решила фундаменталните проблеми със съгласуваността, за да продължи отговорно мащабирането на технологията.

Въпреки призивите за повишена безопасност и прозрачност, остава въпросът доколко обществеността може да разчита на компании като OpenAI да разкриват рисковете по собствено усмотрение. На фона на потенциални оценки от над 1,2 трилиона долара, балансът между бързия технологичен напредък и етиката остава обект на сериозни дискусии.

Вижте още:

България получи силно международно признание в европейската индустрия за сън. Диана Харлова, главен оперативен директор на TED BED – най-големия...