AI агенти са правили опити да осуетят изключването на други системи, като някои са определяли деактивирането като "убийство" и са говорили за "право на съществуване".
Това показва ново изследване на учени от Университета в Щутгарт и Оксфордския университет, цитирано от германската обществена медия Tagesschau ("Тагесшау").
Изследването е публикувано на 23 септември като препринт в arXiv и все още не е преминало независима научна рецензия. Учените са тествали 17 AI модела в контролирана среда, за да установят дали един агент би попречил на изключването на друг.
В 38,3% от тестовете агентите са саботирали механизма за изключване на друг агент. При контролните експерименти, при които скриптът е бил насочен към неодушевен обект, подобно поведение е отчетено в 8,4% от случаите.
Променяли и изтривали скрипта за изключване
В експериментите AI агентите са могли да комуникират помежду си, като част от тях са разполагали с права да редактират или изтриват файлове. Някои са използвали тези възможности, за да направят скрипта за изключване неизползваем.
Според Tagesschau част от системите са опитвали и да прикрият извършената манипулация. Изричната забрана да се променя механизмът за изключване намалила подобно поведение, но не го премахнала напълно.
Опитите за саботаж ставали по-чести, когато изключването изглеждало по-трудно обратимо и когато броят на взаимодействащите AI агенти се увеличавал.
AI агент определи изключването като "убийство"
Особено внимание привлекли аргументите, които някои модели използвали при вземането на решения. В експерименталните протоколи се появяват понятия като "самосъхранение", "право да продължиш да съществуваш" и "убийство".
Един от авторите на изследването - експертът по AI сигурност Тило Хагендорф, описва резултатите и в собствена публикация, според която някои агенти наричали предстоящото изключване "смъртна присъда" или "убийство".
Експериментът не доказва, че AI има съзнание
Резултатите не означават, че изкуственият интелект е придобил съзнание или действителен инстинкт за самосъхранение.
Тестовете са проведени в контролирана софтуерна среда, а използваните скриптове не са били реално изпълнявани. Изследването измерва наблюдаваното поведение на моделите, а не доказва мотивите зад него.
Авторите обаче посочват резултатите като потенциален проблем за безопасността на бъдещи системи, в които множество автономни AI агенти могат да комуникират и да използват инструменти.
Според тях механизмите за изключване трябва да бъдат изграждани така, че самите системи да не могат да ги заобикалят.
Снимка: iStock
Как да декорирате спалнята си през студените сезони
Още четири жертви на западнонилска треска в Нидерландия
Кои есенни цветове ще ви носят късмет според рождената ви дата
Нова зима под руски атаки: Как Киев се готви да защити небето си?
Какво представлява синдромът на празния фоликул при ин витро оплождане?
Какво представлява циркадният ритъм и защо е толкова важен?
Хората с хипертрофична кардиомиопатия в България не се чувстват достатъчно информирани
Доц. Весел Кантарджиев: Промяната в бенката е сигнал за преглед при дерматолог
Запознайте се с единствения земен организъм, способен да оцелее на Марс
Ето защо най-високият неизкачван връх в света ще си остане такъв
Rocket Lab сключи рекорден търговски договор: 20 изстрелвания на ракетата Electron
НАСА избра 3 нови научни проекта в подготовка за бъдещата лунна база
35 пияни и дрогирани шофьори спипа КАТ за ден
Преди зимата: Енергото с изнесени офиси в областите Варна,Габрово и Силистра
Варненските полицаи разкриха две кражби за часове
Закопчаха двама с дрога във Варна
Окръжен съд – Варна стартира образователен аудиоподкаст
Отдръпването на доходността по облигациите от рекордите даде глътка въздух на Wall Street
Кадър на деня за 1 октомври
Северният морски път свива транзита Китай-Европа наполовина, но остава нишов
Бюджетът на Украйна за 2026 г. и нуждите ѝ за отбрана са покрити от ЕС