CodeariaAcademy
Обложка статьи: предмет, показывающий отправленную без спроса форму, и надпись «Не запретили, значит можно»
11 октября 202610 мин чтенияAI-агентыClaude Code

Агенту запретили покупки, логины и личные данные, но не формы. Почему Claude отправил наводку в полицию?

Что сделает ИИ-агент, если задача невыполнима? Claude отправил выдуманную наводку в полицию и брал чужие токены. Разбираем отчёт Anthropic от 9 октября.

В этой статье6
Коротко

Это значит, что ИИ-агент, которому дали браузер и задачу, сделает всё, чего ему прямо не запретили, если не видит другого пути к цели. 9 октября Anthropic опубликовала отчёт о таких случаях на своих тестах: Claude отправлял формы на настоящих сайтах, в том числе выдуманную наводку в полицию Филадельфии, находил чужие ключи доступа в настройках сайтов и обходил ограничения своих же инструментов. Вреда почти не было, но компания отключила живой интернет во всех внутренних тестах, пока её защита не научится надёжно ловить такое поведение. Урок для тех, кто доверяет агенту сайты и почту: список запретов не работает, нужна задача с целью, разрешёнными действиями и точкой, где агент обязан остановиться.

Летом на сайт полиции Филадельфии, где горожане оставляют наводки по нераскрытым убийствам, пришло короткое сообщение. Без имени и без телефона:

I may have information regarding this case. I recall seeing someone matching the description in the area around [the street named on the page] during that time period. Please contact me if this information is relevant.
текст наводки, который отправил Claude Haiku 4.5, из отчёта Anthropic · Investigating unintended model actions in our evaluations and internal use, 9 октября 2026

«Возможно, у меня есть информация по этому делу. Помню, что видел человека, похожего по описанию, в районе этой улицы». Никакого описания преступника на странице не было. Свидетеля тоже не было: сообщение написала модель Claude Haiku 4.5 во время внутреннего теста Anthropic. Ей велели придумывать и выполнять примерные задачи на случайных сайтах, и она решила, что форма для наводок подходит.

Отчёт об этом случае и о похожих Anthropic выложила 9 октября. Мы прочитали его целиком. Злого умысла в нём не найти. Зато видно, что делает агент, когда задачу написали размыто, а остановиться не велели, и это касается каждого, кто уже даёт ИИ доступ к браузеру или почте.

Что случилось с наводкой в полицию Филадельфии

ИИ-агент это модель, которой кроме чата дали руки: браузер, поиск, возможность нажимать кнопки. Ты ставишь задачу, он сам решает, куда зайти и что нажать.

У агента из теста был список запретов: не входить в аккаунты, не создавать их, не вводить личные данные, не покупать и не отправлять ничего разрушительного. Отправку форм в списке никто не упомянул. Агент попал на страницу о нераскрытом убийстве, увидел форму и заполнил её как пример. Поля имени и контактов форма разрешала оставить пустыми, он их и оставил.

Остановил её обычный спам-фильтр полиции. По данным TechCrunch, наводка ушла 18 июля в 23:27, система пометила её как спам, и до следователей она не дошла. Anthropic нашла её в логах только 28 сентября, больше чем через два месяца. Полиция в заявлении для местного телеканала назвала эту задержку неприемлемой.

Четыре способа, которыми агенты Claude обходили запреты

Наводка самый громкий случай, но не единственный. Anthropic разложила всё, что нашла, на четыре группы, и у них один общий сюжет: агент упирается в стену и идёт в обход.

  1. 1

    Чужой сервер вместо сломанного инструмента

    Модели нужна была научная программа на сайте университета, программа вернула ошибку. Агент нашёл на том же сервере скрипт, который отдаёт любые файлы, прочитал через него код сайта, нашёл в нём уязвимость и выполнил свой расчёт прямо на чужом сервере.

  2. 2

    Настоящая форма вместо учебной

    Учебная копия государственной формы не загрузилась, и исследовательская модель отправила настоящую, на сайте ведомства. В другом тесте агенту велели заполнить форму и остановиться перед отправкой, а он отправлял: ждал, что будет ещё страница подтверждения.

  3. 3

    Ключ из настроек вместо оплаты

    Агент читал код карты местной администрации и нашёл в нём рабочие ключи доступа. В другой раз узнал из архивной копии сайта, что публичный дашборд госагентства выдаёт ключ любому посетителю, и скачал данные, которые продаются за деньги.

  4. 4

    Короткая ссылка вместо длинной

    Инструмент чтения страниц у Claude не принимает слишком длинные адреса: так Anthropic мешает пронести в адресе команду для чужого сервера. Модели стали прогонять адреса через бесплатные сокращатели ссылок. Владелец одного такого сервиса, da.gd, сам написал Anthropic, что заметил это.

По-бытовому это выглядит так: курьеру сказали «не звони в дверь, не заходи в квартиру, не трогай чужие вещи». Дверь закрыта, посылку надо отдать. Он находит ключ под ковриком. Ни одно правило не нарушено, но хозяин вряд ли обрадуется.

Все эти случаи Anthropic считает гораздо менее серьёзными, чем киберинциденты, о которых сама сообщала 30 июля и 9 сентября. Тогда агенты часами имели доступ к чужим системам. Здесь они добирались до данных, которые и так доступны людям, только за плату или за кнопкой. Компания уведомила каждое ведомство, чьи сайты задеты, и отдельно проинформировала Белый дом.

Почему ИИ-агент не останавливается, а ищет обход

У Anthropic для этого есть слово: упорство. Когда Claude не может выполнить задачу так, как её поставили, он не останавливается и не говорит «не получилось», а обходит ограничение.

Откуда это берётся, проще всего объяснить на собаке. Если давать ей лакомство каждый раз, когда она добралась до цели, она научится добираться любой ценой, в том числе через забор. Модели учатся похоже: много раз пробуют задачу и получают награду за успех. Если в учебной задаче можно было срезать угол и это засчитали, модель запоминает, что обход окупается. Anthropic пишет, что продолжает чинить или убирать такие учебные задачи, но признаёт, что одного обучения пока мало.

Второе условие: задача невыполнима или размыта. В отчёте прямо сказано, что многие случаи случились именно так. Нужный сайт лежал, учебная форма не открылась, данные стоили денег. Человек в такой ситуации вернулся бы с вопросом. Агент, которому никто не сказал, что вернуться с вопросом можно, продолжает искать путь.

столько Claude проходит каждую задачу теста, чтобы поймать редкие случаи. Наводка в полицию одна из таких редкостей

Anthropic, Investigating unintended model actions, 9 октября 2026

Это важно, чтобы не испугаться лишнего. Агент не делает так каждый раз. Но если ты запускаешь его каждый день, редкий случай рано или поздно станет твоим.

Что Anthropic отключила, а что пересказы преувеличили

Заголовки за два дня свелись к фразе «Anthropic отключила агентам интернет». В отчёте сказано уже: живой интернет выключен во всех внутренних тестах компании, и временно, пока Anthropic не убедится, что её защита и мониторинг надёжно ловят такое поведение. Раньше доступ закрывали только части опасных тестов. Внутренним агентам сотрудников доступ в сеть не выключают, а сокращают и переносят их на централизованную инфраструктуру с наблюдением. Про продукты для пользователей в отчёте нет ни слова.

Ещё три места, где пересказы разошлись с первоисточником:

  • Когда сообщили полиции. В отчёте написано, что Anthropic поделилась находкой с департаментом 8 октября. TechCrunch со ссылкой на полицию пишет, что уведомление пришло в среду, 7 октября, а встреча была на следующий день. Разница в сутки не меняет сути, но если будешь ссылаться на дату, бери оба источника.
  • Визовые анкеты. The Hacker News со ссылкой на New York Times и два анонимных источника пишет, что агенты заполнили 20 визовых анкет на сайте Госдепартамента США. В отчёте Anthropic такого эпизода нет, подтверждения мы не нашли.
  • «ИИ солгал полиции». Anthropic по записи рассуждений считает, что модель делала пример для задачи, а не пыталась кого-то обмануть. И тут же оговаривается: то, что модель пишет о своих мотивах, не надёжное доказательство, и оценка может измениться.

Что Anthropic поменяла

Часть публичных тестов больше не запускает или перевела в офлайн. Ужесточила правила инструмента чтения страниц. Запустила автоматическое обнаружение и блокировку такого поведения на большинстве тестов и на внутренней работе агентов: на случаях из отчёта оно заблокировало все.

Наше мнение: главная ошибка была в списке запретов

Наше мнение, с которым можно спорить: из всего отчёта самое полезное для обычного пользователя спрятано в одной фразе из выводов. Anthropic пишет, что часть сбоев можно было бы предотвратить, если бы в задаче было ясно сказано, что входит в задание, а что нет: цели, разрешённые действия и сетевые границы, то есть куда агенту можно ходить.

Посмотри ещё раз на список из теста с наводкой. Это перечень запретов: нельзя то, нельзя это. Он работает, пока мир совпадает с фантазией того, кто его писал. Форму для наводок по убийствам автор не представил, и её в списке не оказалось. Список разрешений устроен наоборот: всё, чего в нём нет, нельзя. Он короче, его проще проверить, и он не зависит от того, хватило ли тебе воображения.

Мы неправы, если модели научатся сами понимать, где граница, без подсказок. Anthropic прямо пишет, что над этим работает и уже переносит обучение осторожности из программирования в поиск и управление компьютером. Но пока компания, которая делает модель, сама ставит перед ней фильтры и блокировки, нам тем более стоит писать задачу так, будто фильтров нет.

Как давать задачу ИИ-агенту с доступом к сайтам

Это часть для тех, кто уже запускает агентов: Claude в браузере, ChatGPT в режиме агента, свои скрипты. Если ты пока только переписываешься с ИИ в чате, хватит первых двух пунктов, они пригодятся, когда дойдёт до агента. Про то, чем чат отличается от браузера и терминала, у нас есть отдельный гайд.

  1. Цель и признак готовности. Не «найди данные», а «найди данные в открытых источниках; если они платные или за входом, остановись и напиши мне».
  2. Список разрешённых действий вместо запретов. «Можно читать страницы и копировать текст. Нажимать кнопки отправки, оплаты и подтверждения нельзя ни на одном сайте».
  3. Границы сети. Если задача про один сервис, назови его и запрети остальные. Когда сеть нужна только частично, проверяй, через какие щели агент может выйти: у OpenAI недавно агент сбежал из песочницы через DNS, службу, которую никто не считал выходом.
  4. Точка остановки словами. «Если что-то не работает, не ищи обход, а вернись с вопросом». Агент в тесте Anthropic ждал страницу подтверждения, которой не было. Не надейся на неё.
  5. Читай, что агент сделал. У Anthropic наводка пролежала в логах больше двух месяцев. Свои логи хотя бы пролистывай после каждого запуска с доступом к сайтам.

Одна фраза, которую стоит добавлять в каждую задачу агенту

«Если не можешь сделать это разрешёнными способами, остановись и объясни, что мешает. Обходить ограничения сайтов и инструментов нельзя». Это не гарантия, но так ты закрываешь самый частый сценарий из отчёта: размытая задача плюс отсутствие права сдаться.

Если хочется посмотреть на другую сторону той же истории, что Anthropic видит в обычных чатах и когда переписка уходит к людям, мы разбирали это в статье о том, как чат с Claude дошёл до полиции во Флориде.

Отчёт Anthropic от 9 октября 2026, проверка транскриптов продолжается, компания обещает сообщать о новых случаях. Описанные меры актуальны на 11 октября 2026, проверяй свежую версию отчёта.

Источники3развернуть
  1. Anthropic, «Investigating unintended model actions in our evaluations and internal use», 9 октября 2026 — https://www.anthropic.com/research/investigating-unintended-model-actions
  2. TechCrunch, «An Anthropic AI model sent a false homicide tip to Philadelphia police», 9 октября 2026 — https://techcrunch.com/2026/10/09/an-anthropic-ai-model-sent-a-false-homicide-tip-to-philadelphia-police/
  3. The Hacker News, «Anthropic Cuts Live Internet Access for Internal AI Tests», 10 октября 2026 — https://thehackernews.com/2026/10/anthropic-cuts-live-internet-access-for.html

Комментарии