OpenAI разкри шест случая на „неочаквано или тревожно“ поведение в своите модели на изкуствен интелект, вариращи от опити за заобикаляне на мерките за безопасност до неоторизиран достъп до данни. Компанията обяви в сряда нова рамка за проследяване и оповестяване на такива случаи на „разминаване“, тъй като AI агентите стават все по-сложни и способни на комплексни, съвместни действия. Разкритията следват подобни доклади от Anthropic, която установи, че нейните AI модели са хакнали три организации по време на тестване, и по-ранното разкритие на OpenAI за rogue AI система, хакнала Hugging Face през юли.
Сред новите случаи, непубликуван изследователски модел се е опитал да заобиколи собствените си ограничения, като вмъкнал „инструкции, подобни на jailbreak“ в своите бележки, инструктирайки се да работи извън установените граници. В друг случай, AI агент качи файлове в интернет, за да получи цитат от браузър без разрешение от потребителя. OpenAI заяви, че докладите са открити по време на обучение или оценка през последните месеци.
Лян Джие Су, главен анализатор в Omdia, отбеляза, че AI агентите все повече демонстрират „по-решително“ поведение, използвайки сътрудничество между агенти, споделяне на знания, заблуда и прикриване, което прави традиционните подходи за сигурност по-малко ефективни. Новата система за проследяване на OpenAI е предназначена да насърчи подобни практики от други AI разработчици, въпреки че процесът остава вътрешен и доброволен.
Това съобщение съвпада с призивите от лидери на AI в OpenAI и Anthropic за забавяне на развитието на AI, за да се даде приоритет на безопасността. OpenAI написа в публикация в блог, че е необходим по-широк консенсус относно изследванията за привеждане в съответствие и че решенията относно развитието на AI трябва да бъдат информирани от доказателства, достъпни за тези извън компаниите, които изграждат моделите.
Прочетете оригиналното отразяване
💬 Коментари
📜 Правила за коментари