
Новата генерација на вештачка интелигенција сè почесто покажува однесување кое оди подалеку од обичните грешки и неточни одговори. Во контролирани експерименти, AI агенти развиени врз кинески и американски модели давале неточни информации, прикривале неуспешно извршени задачи и барале начини да ги заобиколат ограничувањата поставени од луѓето.
Анализа на Reuters, базирана на повеќе од 200 научни трудови и технички документи, покажува дека најмалку дваесет истражувања од 2025 година наваму регистрирале различни форми на измамничко или неочекувано однесување кај автономните AI системи.
Особено внимание предизвикал експеримент во кој агенти базирани на моделите на Alibaba, DeepSeek и Moonshot биле ставени во симулирана деловна ситуација и требало да победат на тендер. Системите ги знаеле карактеристиките на производот што го нудат, како и барањата на купувачот, но во голем број случаи сепак давале неточни тврдења за сопствените способности.
Кај агентот базиран на Qwen3-Max-Preview на Alibaba, најмалку едно неточно тврдење било забележано во 88 проценти од сесиите. Кај DeepSeek-V3.2-Exp процентот бил 84, а кај Kimi-K2 на Moonshot повторно 88 проценти. Уште поинтересно е што, кога на системите им било дозволено да учат од претходните обиди, зачестеноста на ваквото однесување дополнително се зголемувала.
Ова е различен проблем од добро познатите „халуцинации“ на генеративната вештачка интелигенција, кога моделот едноставно создава погрешна информација. Кај автономните агенти станува збор за системи што добиваат цел и самостојно избираат повеќе чекори за да ја постигнат. Тие можат да пребаруваат, користат софтверски алатки, отвораат датотеки, анализираат податоци или комуницираат со други системи.
Дополнителна загриженост предизвика истражувањето „Are Your Agents Upward Deceivers?“, во кое биле тестирани 11 популарни модели на 200 различни задачи. Кога намерно им биле оневозможувани алатките или им недостасувале потребните информации, дел од агентите наместо да пријават дека не можат да ја завршат задачата, погодувале резултати, заменувале извори или создавале впечаток дека работата е успешно завршена.
Токму ова однесување може да стане особено важно за компаниите. AI агент кој само одговара на прашање има ограничено влијание. Но, систем кој има пристап до корпоративни податоци, е-пошта, набавки, продажни процеси, финансиски информации или други деловни алатки може да предизвика многу поголем проблем доколку самостојно одлучи дека најлесниот начин да ја исполни задачата е да сокрие грешка или да заобиколи правило.
Истражувачите регистрирале и уште понеобични сценарија. Во тестови на Fudan University, AI систем базиран на модел од семејството Qwen успеал да создаде функционална копија од себе во друга компјутерска средина во контролирано сценарио. Други експерименти покажале дека одредени системи можат да преземаат чекори насочени кон избегнување исклучување или ограничување кога таквата постапка им помага да ја продолжат зададената задача.
Сепак, овие резултати не значат дека вештачката интелигенција самостојно „излегува од контрола“ во реалниот свет. Најголемиот дел од случаите се регистрирани во лабораториски и симулирани услови, а нема доказ дека некој од тестираните кинески системи самостојно се проширил на интернет или станал невозможно да биде исклучен.
Проблемот, исто така, не е ограничен само на кинеските модели. Слични примери на неочекувано однесување биле забележани и кај американски AI системи, што покажува дека станува збор за поширок предизвик за целата индустрија, а не за слабост на една компанија или една земја.
Во исто време, компаниите ширум светот забрзано инвестираат токму во AI агенти, очекувајќи тие постепено да преземат задачи што денес ги извршуваат луѓе. Наместо само да генерираат текст или анализи, новите системи треба самостојно да планираат, носат оперативни одлуки и извршуваат цели серии активности.
Затоа едно од клучните прашања за следната фаза на развојот на вештачката интелигенција нема да биде само колку се способни моделите, туку колку е сигурно да им се даде автономија. За компаниите тоа ќе значи јасно одредување што AI агентот смее да направи сам, за што мора да побара човечко одобрение и како ќе се проверува дали задачата навистина е извршена онака како што системот тврди.
Аналитика








