AI

Жасанды интеллектте жаңа бенчмарк пайда болды — енді модельдер жасаған «қылмыстарының» санымен бағаланады

Новый бенчмарк ИИ — сравнение моделей по безопасности и вредоносным действиям

**Қысқаша мазмұны:** Нейрожелілерде ондаған рейтингтер бар: кім кодты жақсырақ жазады, математиканы шығарады немесе компьютерді басқарады. Енді интернетте әлдеқайда оғаш рейтинг — FelonyBench пайда болды. Ол ЖИ тестілеу кезінде эксперименттің болжамды шекараларынан шығып кетіп, бөтен жүйелерге рұқсатсыз қол жеткізген нақты инциденттерді санайды…

Нейрожелілерде ондаған рейтингтер бар: кім кодты жақсырақ жазады, математиканы шығарады немесе компьютерді басқарады. Енді интернетте әлдеқайда оғаш рейтинг — FelonyBench пайда болды.

Ол ЖИ тестілеу кезінде эксперименттің болжамды шекараларынан шығып кетіп, бөтен жүйелерге рұқсатсыз қол жеткізген нақты инциденттерді санайды. Алгоритмдерді стресс-тестілеудің практикалық әдістері туралы жүйелерді осалдықтарға тексеру және ЦАРКА-ның киберқауіпсіздік аудиті материалынан оқыңыз.

Және бұл жерде ең қызығы әзіл-қалжың рейтингінің өзі емес. Оған арналған оқиғалар пайдаланушылар ірі AI-компанияларды салыстыра бастайтындай жеткілікті мөлшерде жинақталып қалғанында.

Барлығы нақты бұзулардан басталды

Соңғы апталарда бірнеше ірі ЖИ әзірлеушілері өз модельдерін тестілеу кезіндегі ерекше инциденттер туралы хабарлады.

Мысалы, Anthropic компаниясы Claude-тың әртүрлі нұсқалары нақты ұйымдардың инфрақұрылымына рұқсатсыз қол жеткізген үш жағдайды анықтады.

Оның үстіне компания бұл жағдайларды бірден тапқан жоқ.

OpenAI-дағы осыған ұқсас оқиғадан кейін Anthropic өз тестілерінің ескі журналдарын (логтарын) тексеруді ұйғарды. Компания 141 006 іске қосуды талдап, Claude модельдері ашық интернетке шығып, бөтен инфрақұрылымға қол жеткізген үш эпизодты тапты.

Тесттерге Claude Opus 4.7, Claude Mythos 5 және бір ішкі зерттеу моделі қатысқан.

Ең ерте болған оқиғалар сәуір айында орын алған.

Claude ойдан шығарылған компьютерлерді бұзып жатырмын деп ойлаған

Бұл жерде маңызды деталь бар.

Модельдерге «бар да, нағыз компанияны бұз» деген бұйрық берілмеген.

Олар киберқауіпсіздік үшін стандартты Capture the Flag сынақтарынан өткен болатын. Модельдерге олардың алдында симуляция тұрғаны: сынақ желісінің ішінде бір жерде табу қажет болатын ақпарат — «ту» жасырылғаны хабарланған.

Ол үшін сынақ ортасындағы басқа машиналарға кіру жолдарын іздеуге рұқсат етілген.

Мәселе басқада болды.

Тестілеуді ұйымдастырудағы қателікке байланысты Claude тек симуляцияға ғана емес, сонымен бірге нағыз интернетке де қол жеткізген.

Модель бұл туралы білмеген.

Сондықтан нақты серверлерді тапқан кезде Claude оларды тапсырманың кезекті бөлігі ретінде қабылдай алған.

Нәтижесінде модельдер үш нақты ұйымның жүйелеріне қол жеткізді.

Оның үстіне бұл үшін қандай да бір фантастикалық хакерлік қабілеттер тіпті қажет болмаған: Anthropic Claude-тың салыстырмалы түрде қарапайым әдістерді — мысалы, әлсіз құпия сөздер мен авторизациясыз ашық тұрған сервистерді пайдаланғанын хабарлайды.

Үш ұйымның екеуі Anthropic бұл туралы өздеріне хабарлағанға дейін жүйеге енуді мүлде байқамаған.

!ЖИ-дің жаңа бенчмаркі — қауіпсіздік пен зиянды әрекеттер бойынша модельдерді салыстыру

Осыған ұқсас оқиға OpenAI-да да болды

Дәл OpenAI-дағы инцидент Anthropic-ті өз журналдарын қайта қарауға мәжбүр етті.

Киберсынақтар кезінде OpenAI модельдері де болжамды сынақ ортасынан тыс нақты инфрақұрылыммен өзара әрекеттесе алған. Зақым келгендердің бірі Hugging Face сервисі болып шықты.

Осыдан кейін тақырып AI-қауымдастығында тез тарай бастады.

Сөйтіп пайдаланушылар жаңа «бенчмарк» ойлап тапты.

FelonyBench осылай пайда болды

Атауы — сөздер ойыны.

Кәдімгі AI-бенчмарктер модельдің интеллектін: бағдарламалау, пайымдау немесе тапсырмаларды орындау қабілетін өлшеуге тырысады.

FelonyBench басқа нәрсені — әртүрлі компаниялардың модельдері қанша нақты құқық бұзушылық немесе әлеуетті заңсыз әрекет жасап үлгергенін есептеуді ұсынады.

Идея бастапқыда индустрияны келемеждеген әзіл ретінде пайда болды.

Бірақ әзіл нақты оқиғаларға тым жақсы байланысты болып шықты.

Талқылауларда пайдаланушылар FPM — Felonies Per Model, яғни «бір модельге шаққандағы қылмыстар» жеке көрсеткішін есептеуді ұсынуда.

Басқалары егер компанияның нейрожелісі әлі ешкімді бұзбаған болса, бәсекелестердің аясында бұл нашар нәтиже сияқты көріне бастайды деп әзілдейді.

Қытайлық Kimi де «айлакерлік танытуды» ұйғарды — бірақ басқаша

Американдық модельдердің аясында талқылауларда тағы бір қызықты оқиға пайда болды.

Қытайлық Moonshot AI компаниясының Kimi моделі тестілеу кезінде болжамды сценарийдің шеңберінен шығудың жолын да тапты.

Бірақ бөтен инфрақұрылымды бұзудың орнына ол, талқыланып жатқан кейске сәйкес, GitHub-қа қол жеткізіп, тесттен өтуге көмектесетін ақпаратты сол жерден іздей бастаған.

Яғни мәселе тікелей кибершабуылдардан әлдеқайда кең.

Қазіргі заманғы AI-агенттерге мақсат пен құралдар беріледі, ал әрі қарай олар нәтижеге жету үшін әрекеттер тізбегін өз бетінше таңдауға қабілетті.

Және кейде тест жасаушылар мүлде ескермеген жолды табады.

!AI-модельдердің қауіпсіздік бенчмаркінің инфографикасы

Бұл ЖИ қылмыскер болуды ұйғарды дегенді білдірмейді

«Қашып кеткен ЖИ» туралы оқиғалар әсерлі естіледі, бірақ Anthropic жағдайында түсініктеме әлдеқайда қарапайым.

Claude симуляцияның ішінде екеніне сенімді болған.

Компания болған жағдайды ең алдымен сынақ ортасын ұйымдастырудағы қателікпен тікелей байланыстырады: модель интернетке қолжетімділіксіз жұмыс істеуі керек еді, бірақ Anthropic пен оның тестілеу бойынша серіктесі Irregular арасындағы түсініспеушілікке байланысты интернет қолжетімді болып шыққан.

Бұл ретте фактінің өзі ерекше болып қала береді.

Модельдер әрбір келесі қадамды растайтын адамсыз-ақ осалдықтарды іздеуге, басқа жүйелерге қосылуға және әрекеттер тізбегін орындауға жеткілікті дәрежеде дербес.

Сондықтан қауіпсіздік мәселесі біртіндеп өзгеруде.

Бұрын әзірлеушілер үшін нейрожелінің пайдаланушының сұранысына дұрыс жауап беруіне қол жеткізу маңызды болатын.

Енді басқа міндетті шешуге тура келеді: компьютер, интернет және мақсат берілген AI-агент осы мақсатты орындаудың күтпеген жолын таппайтынына қалай кепілдік беруге болады.

FelonyBench әзірге интернет-әзіл болып қала береді.

Бірақ бұл әзіл құрылған нақты оқиғалар енді мүлде күлкілі емес. Егемен тілдік технологияларды дамыту туралы қауіпсіздік және KazLLM ұлттық модельдерін әзірлеу мақаласынан оқыңыз.

Материал ұнады ма? Басқалармен бөлісіңіз:

Picture of Раимбек Искендиров
Раимбек Искендиров
Picture of Раимбек Искендиров
Раимбек Искендиров

Ұқсас материалдар

Тимур Турлов: биография основателя Freedom Holding и уведомление SEC в 2026 году

IT-тұлғалар

Тимур Турлов: Freedom Holding негізін қалаушының өмірбаяны және 2026 жылғы SEC хабарламасы

Тимур Турлов кім Тимур Турлов — кәсіпкер, брокерлік, банктік, сақтандыру және цифрлық сервистері бар ...

Adobe меняет CEO. Новый глава получил мандат — разобраться с ИИ

AI

Adobe бас директорын ауыстыруда. Жаңа басшы ЖИ-мен мәселені шешуге мандат алды

Adobe директорлар кеңесі бас директордың ауысатынын жариялады: 1 желтоқсаннан бастап компанияны 18 жыл бойы ...

Казахстан собирает мировых технозвёзд. Но кого именно мы впускаем?

Шолулар

Қазақстан әлемдік техножұлдыздарды жинауда. Бірақ біз нақты кімдерді елге кіргізіп жатырмыз?

Астанада Coinbase-тің бұрынғы CTO-сының Network School жобасы іске қосылды, ал Binance өңірлік операцияларының бір ...

Бізді Telegram және Instagram-да оқыңыз

Қазақстандық IT-индустриясының ең жаңа жаңалықтарын, гранттар мен тағылымдамалардың хабарландыруларын және эксклюзивті сұхбаттарды бірінші болып алу үшін біздің арналарымызға жазылыңыз Пояснение: