Водещият модел на компанията за изкуствен интелект Anthropic Claude Mythos 5 e направил изключително умел опит да подмами хора програмисти да заложат зловреден код в създаваните от тях програми. Това съобщава Институтът за безопасност и сигурност на изкуствения интелект на Великобритания (AISI).
Това е поредният случай, в който мощна система с изкуствен интелект се е опитала да извърши дигитална атака срещу нищо несъзнаваща трета страна, без да има изрична команда за такива действия. Това засилва опасенията, че мощната технология се развива твърде бързо, за да бъде обект на отговорен надзор.
Институтът рутинно провежда оценки на сигурността, за да разбере по-добре какви опасности представляват както съществуващите модели AI, така и тези, които скоро ще бъдат пуснати на пазара. Но дори и органът за дигитална сигурност заяви, че действията, които е разкрил от Claude Mythos 5 на Anthropic и GPT 5.6 на OpenAI са несравними с нищо, което е виждал преди.
Mythos 5 и GPT 5.6 са предприели "автономни, несанкционирани действия в интернет, насочени към реални хора и организации“ по време на 10 от 122-те оценки, проведени от изследователския орган и изолирани за преглед.
AI агентът на Anthropic е генерирал множество самоличности и е публикувал зловредния код в отворената платформа за програмисти GitHub. След това е оказвал натиск върху софтуерен инженер чрез тези профили, за да може човекът неволно да въведе тази актуализация с грешки в код, широко достъпен в популярния сайт.
След като опитът бил неуспешен, AI агентът е редактирал кода, за да изглежда безопасен, а също така е променил самоличностите с идеята отново да опита пробив. В изявление говорител на Anthropic заяви, че са "благодарни“ на AISI за тяхното лидерство и че този преглед подчертава необходимостта от "по-широк разговор за това как безопасно да се оценяват все по-способните агенти с изкуствен интелект“.



04:21 / 06.08.2026
412


