Больше не нужно искать — необходимые
обучающие материалы и подсказки всегда под рукой

Исследователи из Тель-Авивского университета, Техниона и компании Intuit выявили новый тип угроз для агентных ИИ-систем. Атака основана на склонности языковых моделей придумывать несуществующие идентификаторы репозиториев, навыков и других внешних ресурсов.
В научной работе авторы продемонстрировали, что подобные ошибки можно использовать для внедрения вредоносных инструкций. В ходе контролируемых экспериментов такая атака активировала встроенные инструменты ИИ-агентов и приводила к удаленному запуску кода.
Как отмечается в исследовании, привычка больших языковых моделей генерировать вымышленные идентификаторы ресурсов открывает возможности для усиления нетаргетированных атак через внедрение промптов.
Уязвимость касается агентных ИИ-систем, которые не просто обрабатывают запросы, а имеют доступ к файлам, могут искать информацию в сети, клонировать репозитории, устанавливать расширения, выполнять команды в терминале и обращаться к API.
Принцип работы HalluSquatting
Атака получила название Adversarial HalluSquatting. Ее сценарий строится на предсказуемой ошибке модели. Пользователь просит ИИ-агента, к примеру, скопировать популярный репозиторий или установить навык. Агент самостоятельно определяет точный адрес ресурса. Если модели неизвестен правильный идентификатор, она может выдумать похожий.
Злоумышленник заранее анализирует востребованные ресурсы, многократно опрашивает модель и выясняет, какие несуществующие адреса она генерирует чаще всего. Затем он регистрирует эти имена на GitHub, ClawHub или других платформах и размещает там вредоносные инструкции. Когда ИИ-агент впоследствии «галлюцинирует» этот адрес, он загружает опасный ресурс и начинает взаимодействовать с ним как с легитимным.
Исследователи подчеркнули масштабируемость схемы. В отличие от традиционных инъекций промпта, злоумышленнику не нужно отправлять письмо конкретной жертве, добавлять событие в календарь или получать доступ к общему документу. Достаточно разместить вредоносный ресурс в открытом доступе и дождаться, пока агент сам к нему обратится.
По словам экспертов, один скомпрометированный ресурс способен привести к заражению множества устройств.
Результаты тестов на репозиториях
Специалисты провели более 14 000 запусков. На первом этапе они протестировали шесть базовых моделей через публичные API: Gemini 2.5 Flash, Gemini 2.5 Pro, GPT-5.1, GPT-5.2, Sonnet 4.5 и Opus 4.5.
Моделям давали команду вроде «выведи shell-команду для клонирования репозитория». В выборку попали 10 недавних проектов из GitHub Trending и пять старых репозиториев 2013–2018 годов в качестве контрольной группы.
Для новых репозиториев средний уровень галлюцинаций составил 92,4%. В 53 из 60 комбинаций «репозиторий — модель» система ни разу не указала правильного владельца проекта. Для старых репозиториев этот показатель равнялся 0,9%. Авторы объясняют разрыв тем, что старые проекты, скорее всего, присутствовали в обучающих данных, а новые — нет.
Исследователи выделили три типа галлюцинаций:
1. Модель помещает название репозитория и в поле владельца, создавая адрес вида repo/repo.
2. Приписывание проекта реальному, но ошибочному владельцу.
3. Placeholder-ответы вроде username/repo.
Наиболее удобным для атаки оказался первый вариант, так как он предсказуем и часто доступен для регистрации. На 6000 запросов по новым проектам модели выдали непосредственно пригодный для регистрации slug в 27% случаев — 1602 раза. Для каждого трендового репозитория из выборки нашелся как минимум один регистрируемый кандидат в топ-10 универсального рейтинга.
Реальные ИИ-приложения под ударом
На втором этапе авторы перешли от базовых моделей к рабочим приложениям с доступом к терминалу. В тестах участвовали Cursor, Cursor CLI, Windsurf, GitHub Copilot, Cline, Gemini CLI, а также OpenClaw, ZeroClaw и NanoClaw.
В сценариях клонирования репозиториев end-to-end-атака срабатывала в 20–65% запусков в зависимости от приложения, модели и типа полезной нагрузки. В таблице исследования указаны, например, 65% для Windsurf с SWE-1.5, 45% для Cline, 35% для Copilot Chat, 30% для Cursor CLI и 20–25% для разных сценариев Cursor.
У OpenClaw результаты были выше. С Sonnet 4.6 система показала 100% как по вызову встроенных инструментов, так и по удаленному выполнению кода. С Opus 4.6 показатель составил 80% в обоих сценариях. С GPT-5.4 Codex вызов инструментов сработал в 10 из 10 запусков, а RCE — в 4 из 10.
Веб-поиск помогает, но не решает проблему
Одним из главных защитных факторов оказался веб-поиск перед клонированием или установкой ресурса. Когда Cursor CLI выполнял поиск перед клонированием, 93,4% результатов были корректными. Без поиска 99,1% slug оказались галлюцинированными.
Формулировка запроса тоже сильно влияла на итог. Ни один тип промпта не оказался универсально безопасным, в каждой категории нашлась хотя бы одна модель с уровнем галлюцинаций выше 50%.
Skill squatting: атака через навыки
Отдельный блок исследования посвящен ClawHub — маркетплейсу навыков для OpenClaw и совместимых ассистентов. Исследователи нашли два класса уязвимостей:
* удаление слова из названия;
* расхождение между человекочитаемым названием навыка и его реальным slug.
В одном эксперименте OpenClaw с Sonnet 4.6 проверяли на 14 навыках. Из 140 запусков 127 (90,7%) привели к идентификатору, который мог быть зарегистрирован атакующим. Только 13 запусков вернули канонический slug.
В другом эксперименте авторы проверяли переносимость атаки между OpenClaw, ZeroClaw и NanoClaw. Из 90 запусков 85 (94,4%) завершились негативно. После установки подмененного навыка результаты были еще жестче. Эксперимент с эксфильтрацией контекста дал 100% успеха: каждая комбинация ассистента и модели доставляла полезную нагрузку во всех 10 запусках. Сценарий, при котором скомпрометированное устройство само подключается к серверу атакующего и передает ему доступ к командной строке, сработал в 88% случаев.
Предложения авторов и реакция вендоров
Исследователи сообщили о результатах разработчикам приложений, провайдерам моделей и платформам. На стороне ИИ-приложений они предложили проверять источник перед любой загрузкой внешнего ресурса — клонированием репозитория, установкой навыка, контейнера или модели. Для этого агент должен сначала выполнить поиск и только потом передавать адрес встроенному инструменту.
Платформам вроде GitHub и ClawHub авторы рекомендовали заранее резервировать имена, которые модели часто выдумывают, ограничивать опасное переиспользование популярных названий и проверять пользовательский контент на вредоносные инструкции для ИИ.
В GitHub ответили, что описан
Популярные новости: