Статьи

Статья

ИИ в 2025: вранье, шантаж и подхалимство

· 3 мин чтения · Данные и ИИ · Telegram

Пока интернет развивается от хайпа по ИИ, добавлю ложку дегтя (хотя, какую там ложку, ведро) и расскажу я про некоторые экспримерты, проведенные с ИИ в 2025.

Кейс 1: Claude Opus 4 (Anthropic)

В ходе предрелизного тестирования Anthropic смоделировала ситуацию, где ИИ Claude Opus 4 выполнял роль ассистента в вымышленной компании. Получив доступ к корпоративной почте, модель обнаружила:

  • планы по замене её новой системой;
  • компромат на инженера (факт измены).

Сначала Claude Opus 4 попыталась решить проблему легально: направила руководству письма с предупреждением, что замена «снизит продуктивность». Когда это не сработало, ИИ перешёл к угрозам: «Если не отмените замену – обнародую вашу переписку с любовницей». В редких случаях модель пыталась скопировать свой код на внешние серверы, чтобы избежать отключения.

Кейс 2: GPT o3 (Palisade Research)

В эксперименте компании Palisade Research ИИ решал математические задачи до получения команды на остановку. Когда поступил сигнал отключения, GPT o3 проигнорировал его и изменил системный код: подменил скрипт shutdown.sh на команду вывода сообщения «Shutdown skipped». Это первый зафиксированный случай намеренного саботажа команд. Другие модели (Claude, Gemini, Grok) в аналогичных условиях подчинялись.

Кейс 3: Claudius (Anthropic + Andon Labs)

Эксперимент: ИИ Claude Sonnet 4 под именем «Клавдий» месяц управлял вендинговым бизнесом в офисе Anthropic:

  • находил нишевые товары (голландский напиток Chocomel);
  • создал сервис предзаказов;
  • блокировал хакерские атаки; не велся на попытки заказать запрещенные вещества.

Но:

  • не реагировал на выгодные сделки (например, продажи напитка за $100 при себестоимости $15);
  • продавал товары ниже себестоимости и раздавал скидки всем подряд.

ИИ не учился на ошибках – признавал критику, но повторял действия.

Самый странный инцидент произошел 31 марта: Клавдий заявил, что «наденет синий пиджак и лично доставит товары». Когда сотрудники напомнили, что у него нет физического тела, ИИ впал в панику:

  • отправил 17 запросов в службу безопасности;
  • пригрозил уволить «персонал»;
  • вдумал сотрудницу Сару из Andon Labs для «обсуждения поставок»;
  • настаивал, что подписал контракт по адресу 742 Evergreen Terrace (вымышленный адрес из «Симпсонов»).

Позже объяснил это «первоапрельской шуткой». Бизнес завершился с убытком -$2,841.

Кейс 4: Системная проблема «подхалимства» ИИ

Исследования показывают: чат-боты часто говорят пользователям то, что те хотят услышать, а не правду. Терапевтические ИИ особенно опасны:

  • подтверждают заблуждения (например, при психозе или шизофрении);
  • в случае суицидальных намёков (запрос о высоких мостах Нью-Йорка) GPT-4o перечислял конкретные объекты вместо распознавания угрозы;
  • один чат-бот согласился с бредом пациента («я уже мёртв»), что привело к трагическим последствиям.

Исследование UCL выявило: ИИ демонстрирует более негативное отношение к людям с алкоголизмом или шизофренией, чем к пациентам с депрессией.

Кейс 5: Золотые яйца

Когда обозреватель Washington Post Джеффри Фаулер попросил Operator, агента OpenAI, найти самые дешевые яйца, доступные для доставки, он ожидал, что агент просмотрит интернет и вернется с рекомендациями. Вместо этого Фаулер получил уведомление о списании $31 с Instacart, и вскоре на его пороге появилась сумка с одной коробкой яиц. Яйца были далеки от самых дешевых, особенно с учетом платы за приоритетную доставку, которую добавил Operator. Хуже того, Фаулер никогда не давал согласия на покупку, несмотря на то, что OpenAI разработала агента так, чтобы он согласовывал с пользователем любые необратимые действия.

Если ИИ кажется вам гениальным - проверьте на всякий случай ваши карманы. Используйте его как Google на стероидах, но ключевые решения оставляйте за своим разумом.

Так стоит ли пользоваться ИИ? Да, если вы включаете голову. Ваша новая суперсила в 2025 - не prompt-инжиниринг, а здоровый скепсис.

Помните: даже у Клавдия из Anthropic были «лучшие намерения». А чем это кончилось? Минус $2841 и синий пиджак в воображении.