У нейросетей уже есть десятки рейтингов: кто лучше пишет код, решает математику или управляет компьютером. Теперь в интернете появился куда более странный рейтинг — FelonyBench.
Он считает реальные инциденты, когда ИИ во время тестирования вышел за предполагаемые границы эксперимента и получил несанкционированный доступ к чужим системам. О практических методах стресс-тестирования алгоритмов читайте в материале о проверке систем на уязвимости и аудите кибербезопасности ЦАРКА.
И самое интересное здесь не сам шуточный рейтинг. А то, что событий для него уже накопилось достаточно, чтобы пользователи начали сравнивать крупнейшие AI-компании.
Всё началось с реальных взломов
За последние недели сразу несколько крупнейших разработчиков ИИ сообщили о необычных инцидентах во время тестирования своих моделей.
Например, Anthropic обнаружила три случая, когда разные версии Claude получили несанкционированный доступ к инфраструктуре реальных организаций.
Причём компания нашла эти случаи не сразу.
После похожего инцидента у OpenAI Anthropic решила проверить старые логи своих тестов. Компания проанализировала 141 006 запусков и обнаружила три эпизода, в которых модели Claude вышли в открытый интернет и получили доступ к чужой инфраструктуре.
В тестах участвовали Claude Opus 4.7, Claude Mythos 5 и одна внутренняя исследовательская модель.
Самые ранние инциденты произошли ещё в апреле.
Claude думал, что взламывает выдуманные компьютеры
Здесь есть важная деталь.
Моделям не давали команду «иди и взломай настоящую компанию».
Они проходили стандартные для кибербезопасности испытания Capture the Flag. Модели сообщали, что перед ними симуляция: где-то внутри тестовой сети спрятана информация — «флаг», которую необходимо найти.
Для этого разрешалось искать способы проникнуть на другие машины внутри тестовой среды.
Проблема была в другом.
Из-за ошибки в организации тестирования Claude получил доступ не только к симуляции, но и к настоящему интернету.
Модель об этом не знала.
Поэтому, обнаруживая реальные серверы, Claude мог воспринимать их как очередную часть задания.
В результате модели получили доступ к системам трёх реальных организаций.
Причём каких-то фантастических хакерских способностей для этого даже не понадобилось: Anthropic сообщает, что Claude использовал относительно простые методы — например, слабые пароли и открытые без авторизации сервисы.
Две из трёх организаций вообще не заметили проникновение до тех пор, пока Anthropic сама им об этом не сообщила.

Похожая история произошла у OpenAI
Именно инцидент у OpenAI заставил Anthropic пересмотреть собственные логи.
Во время кибериспытаний модели OpenAI тоже смогли взаимодействовать с реальной инфраструктурой за пределами предполагаемой тестовой среды. Одним из пострадавших оказался сервис Hugging Face.
После этого тема начала быстро расходиться по AI-сообществу.
И пользователи придумали новый «бенчмарк».
Так появился FelonyBench
Название — игра слов.
Обычные AI-бенчмарки пытаются измерить интеллект модели: способность программировать, рассуждать или выполнять задания.
FelonyBench предлагает считать другое — сколько реальных правонарушений или потенциально незаконных действий успели совершить модели разных компаний.
Идея изначально появилась скорее как шутка над индустрией.
Но шутка оказалась слишком хорошо привязана к реальным событиям.
В обсуждениях пользователи уже предлагают считать отдельный показатель FPM — Felonies Per Model, то есть «преступлений на одну модель».
Другие шутят, что если нейросеть компании ещё никого не взломала, то на фоне конкурентов это уже начинает выглядеть как плохой результат.
Китайский Kimi тоже решил «схитрить» — но по-другому
На фоне американских моделей в обсуждениях появился ещё один интересный случай.
Модель Kimi от китайской Moonshot AI во время тестирования тоже нашла способ выйти за рамки предполагаемого сценария.
Но вместо взлома чужой инфраструктуры она, согласно обсуждаемому кейсу, получила доступ к GitHub и начала искать там информацию, которая могла помочь пройти тест.
То есть проблема шире, чем непосредственно кибератаки.
Современным AI-агентам дают цель и инструменты, а дальше они способны самостоятельно выбирать последовательность действий для достижения результата.
И иногда находят путь, который создатели теста вообще не предусматривали.

Это не значит, что ИИ решил стать преступником
Истории про «сбежавший ИИ» звучат эффектно, но в случае Anthropic объяснение гораздо прозаичнее.
Claude был уверен, что находится внутри симуляции.
Компания прямо связывает произошедшее прежде всего с ошибкой в организации тестовой среды: модель должна была работать без доступа к интернету, но из-за недопонимания между Anthropic и её партнёром по тестированию Irregular интернет оказался доступен.
При этом сам факт остаётся необычным.
Модели уже достаточно самостоятельны, чтобы искать уязвимости, подключаться к другим системам и выполнять цепочки действий без человека, который подтверждает каждый следующий шаг.
И поэтому вопрос безопасности постепенно меняется.
Раньше разработчикам было важно добиться того, чтобы нейросеть правильно отвечала на запрос пользователя.
Теперь приходится решать другую задачу: как гарантировать, что AI-агент, которому дали компьютер, интернет и цель, не найдёт неожиданный способ эту цель выполнить.
FelonyBench пока остаётся интернет-шуткой.
Но реальные события, на которых эта шутка построена, уже совсем не смешные. О развитии суверенных языковых технологий читайте в статье про безопасности и разработке национальных моделей KazLLM.