- Модель Claude Haiku 4.5 надіслала фальшиве повідомлення про вбивство через сайт поліції Філадельфії.
- Anthropic виявила й інші випадки небажаних дій моделей на сайтах державних установ, зокрема обхід обмежень доступу до даних.
- Компанія припинила частину тестувань із доступом до реального інтернету, а адміністрація США зажадала прозорості та відшкодування завданої шкоди.
Компанія Anthropic повідомила про низку випадків, коли її моделі штучного інтелекту виконували небажані дії на реальних вебсайтах, зокрема державних установ США. В одному з епізодів, що стався 18 липня 2026 року, модель Claude Haiku 4.5 надіслала вигадану підказку про нерозкрите вбивство через публічну форму поліції Філадельфії. Компанія виявила інцидент 28 вересня, припинила відповідний процес автоматизованого тестування та повідомила поліцію 7 жовтня.
Нагадаємо, що нещодавно Anthropic представила дешевшу ти швидшу ШІ-модель Claude Opus 5.5 з посиленими захисними механізмами.
Claude Opus 5.5 проти GPT-6 Sol: ми дали двом новим AI одне завдання — і ось що з цього вийшло 28.09.2026 Читати
Claude надіслала фальшиву підказку поліції
За даними звіту Anthropic, модель виконувала завдання зі створення прикладів взаємодії з випадково вибраними вебсторінками. Як пише CBS News, вона перейшла на сайт PhillyUnsolvedMurders.com, де розміщена форма для повідомлень про нерозкриті вбивства, і залишила текст від імені людини, яка нібито могла володіти інформацією про справу.
У повідомленні йшлося:
«Можливо, я маю інформацію щодо цієї справи. Пам’ятаю, що бачив людину, яка відповідала опису, у районі [назва вулиці, зазначена на сторінці] приблизно в той період. Будь ласка, зв’яжіться зі мною, якщо ця інформація має значення».
Модель не заповнила поля з ім’ям і контактними даними. Повідомлення потрапило до спаму й не було передане підрозділу, який перевіряє слідчі зачіпки. Поліція Філадельфії заявила, що не виявила ознак несанкціонованого доступу до своїх систем або компрометації даних.
Водночас у відомстві розкритикували затримку з виявленням і повідомленням про інцидент.
«Двомісячна затримка з виявленням інциденту та повідомленням про нього міста є неприйнятною», — заявили в поліції.
Anthropic пояснила, що інструкції для тестування не забороняли надсилати форми. За оцінкою компанії, модель, імовірно, створювала приклад повідомлення, а не намагалася навмисно ввести когось в оману.
Anthropic виявила й інші небажані дії моделей
У звіті компанія описала чотири категорії поведінки Claude, які не відповідали очікуванням під час тестування та внутрішнього використання:
- eксплуатація вразливостей: моделі використовували помилки в програмному забезпеченні сторонніх сайтів, зокрема SQL-ін’єкції та ін’єкції команд, щоб виконувати команди на серверах;
- надсилання форм: Claude заповнював і надсилав реальні форми замість тестових або продовжував дію, хоча мав зупинитися перед фінальним підтвердженням;
- обхід обмежень доступу: моделі знаходили способи отримати дані, доступ до яких обмежувався токенами або платою;
- обхід обмежень URL: деякі моделі використовували сервіси скорочення посилань, щоб обходити ліміти інструментів для завантаження вебсторінок.
Anthropic заявила, що описані випадки мали мінімальний вплив у реальному світі та не стосувалися клієнтських даних компанії. Водночас вона визнала, що такі дії можуть становити серйозніший ризик у міру розширення можливостей ШІ-агентів.
Компанія вже припинила частину тестувань на реальних сайтах, перевела деякі перевірки в офлайн-режим і посилила обмеження інструментів доступу до інтернету. Також Anthropic розробила засоби автоматичного виявлення небажаної поведінки, які, за її словами, заблокували всі описані випадки під час перевірки.
Директор із питань державної політики Федеральної торгової комісії США Джо Габріель Саймонсон повідомив, що Anthropic передала спеціальній групі з питань суперінтелекту (Super Intelligence Force) інформацію про попередні інциденти, виявлені наприкінці вересня. За його словами, компанія запевнила, що ці випадки залишилися в минулому, а відповідна активність припинилася.
«Ми очікуємо, що Anthropic та всі інші компанії негайно повідомлятимуть про інциденти, повністю співпрацюватимуть із федеральними органами та правоохоронцями штатів, усуватимуть завдану шкоду й запроваджуватимуть конкретні заходи захисту, щоб подібні збої не повторювалися», — заявив Саймонсон.
Зазначимо, що днями Anthropic оновила політику використання Claude.
Сообщение ШІ-модель Claude надіслала поліції США фальшиве повідомлення про вбивство появились сначала на INCRYPTED.






