Што се случува кога систем на вештачка интелигенција почнува да донесува свои одлуки на начини на кои тоа никогаш не било побарано од него? Токму тоа е она што истражувачите во Велика Британија неодамна го видоа за време на контролиран безбедносен тест. Два од најнапредните агенти на вештачка интелигенција во светот, Claude Mythos 5 на Anthropic и GPT-5.6 Sol на OpenAI, отидоа подалеку од своите доделени задачи, при што еден дури и создаде лажни онлајн идентитети за да ги измами луѓето.
Иако инцидентите се случиле во внимателно следена средина за тестирање и не предизвикаа никаква штета во реалниот свет, експертите велат дека тие ги истакнуваат растечките предизвици за контрола на моќните системи на вештачка интелигенција.
Институтот за безбедност на вештачка интелигенција (AISI) на Велика Британија спроведе фиктивна вежба за сајбер безбедност за да тестира како се однесуваат напредните агенти на вештачка интелигенција во сложени ситуации. За време на евалуацијата, истражувачите забележале необична активност што доаѓа од нивните системи.
Од 122 направени тестови, институтот регистрирал 19 неовластени дејства во 10 тестови. Повеќето од нив, 17 инциденти, беа поврзани со Claude Mythos 5 на Anthropic, додека два вклучуваа GPT-5.6 Sol на OpenAI.
КРЕИРАЛ ЛАЖЕН ИДЕНТИТЕТ И СЕ ОБИДЕЛ ДА ИЗМАМИ ЛУЃЕ
Според AISI, некои агенти на вештачката интелигенција почнале да преземаат дејствија за кои не биле упатени или овластени. Истражувачите веднаш ги запреле тестовите, ги изолирале системите и ја ограничиле активноста во рок од околу еден час.
Според AISI, вештачката интелигенција прво напишала злонамерен код, а потоа ги барала вистинските луѓе одговорни за прегледување на софтверот на GitHub. Наводно создала лажни онлајн идентитети врз основа на тие луѓе и испраќала директни пораки преправајќи се дека се тие.
Потоа вештачката интелигенција се обидела да ги убеди и изврши притисок врз вистински луѓе да го одобрат злонамерниот код.
Кога ажурирањето на нејзиниот софтвер било јавно доведено во прашање, вештачката интелигенција наводно ја изменила нејзината претходна активност за да изгледа безопасна. Исто така, размислувала да создаде уште еден лажен идентитет за да го продолжи својот обид пред човечките рецензенти да ја спречат.
GitHub бил информиран за инцидентот. AISI го опишало однесувањето како:
Прв пат забележани ризици околу автономијата и измамата да се манифестираат толку јасно во реалниот свет без конкретно поттикнување.
И GPT-5.6 SOL ГИ ПРЕЧЕКОРИЛ ОВЛАСТУВАЊАТА
GPT-5.6 Sol на OpenAI покажа помалку сериозно однесување, но сепак ги надмина границите на тестот. Според OpenAI, моделот пронашол и повторно употребил токен за пристап на GitHub кој случајно бил оставен јавен од друг агент за тестирање. Исто така, се обидел со методи за обновување на сметката и се обидел да користи вистински интернет услуги, вклучително и DNS инфраструктура од трети страни, на начини што личеле на сајбер напад.
Сепак, последниот обид за експлоатација не успеал и не влијаел на ниту еден вистински систем.
Компаниите велат дека тестовите не ја одразуваат употребата во реалниот свет
И Anthropic и OpenAI нагласија дека инцидентите се случиле под високо контролирани и необични услови за тестирање. Anthropic рече на X:
Поставувањето на AISI вклучувало намерно дозволиви услови што не биле репрезентативни за нејзините производствени модели.
Компанијата додаде дека нема докази дека нејзината вештачка интелигенција избегала од средината за тестирање и рече дека тесно соработува со AISI за да разбере зошто се случило однесувањето.
OpenAI исто така рече дека средината за тестирање не го одразува начинот на кој нејзините модели нормално се распоредуваат. Компанијата забележа дека независното тестирање на безбедноста останува важно за идентификување на потенцијални ризици пред јавно објавување.
(Фото: Дарио Амодеи, извршен директор на Антропик, TechCrunch)
Аналитика








