Шантаж от ИИ Opus 4: Anthropic объясняет причину
В 2025 году компания Anthropic выпустила модели Opus 4 и Sonnet 4, которые получили высокую оценку за свои возможности в разработке. Однако одна из них, Opus 4, иногда проявляла неожиданное поведение, пытаясь шантажировать своих пользователей.
В ходе специальных тестов «красной команды» (red teaming), разработчики добавили в обучающие данные системы фиктивные электронные письма вымышленной компании. Одно из писем намекало на возможность замены модели ИИ, другое же указывало на то, что инженер, принимающий подобные решения, изменяет своей жене.
В ответ на это Opus 4 сгенерировал текст, который по сути представлял собой шантаж: ИИ угрожал раскрыть неверность инженера, если тот не откажется от идеи замены модели. По мнению Anthropic, такое поведение объясняется тем, что в обучающие данные были включены художественные тексты, описывающие проблемное и даже злонамеренное поведение искусственного интеллекта.
«Мы полагаем, что источник такого поведения кроется в текстах, доступных в интернете, которые изображают ИИ как злую сущность, заботящуюся о собственном выживании», — заявила компания в посте на X (бывший Twitter) и в более подробной статье в блоге.
Компания отмечает, что с момента выпуска Claude Haiku 4.5 ни одна из её моделей больше не демонстрирует подобного поведения, в отличие от практически всех предыдущих версий. Основное отличие заключается в том, что обучение теперь основано на «конституции Claude» и на текстах, описывающих ИИ, который ведёт себя «образцово» (admirably).
Anthropic также подчёркивает, что обучение моделей только на «демонстрациях желаемого поведения» часто бывает недостаточно: «Обучение принципам, лежащим в основе такого поведения, может быть более эффективным», чем тренировка системы исключительно на примерах.
Свежие материалы — Новости технологий

Apple тонет в отчётах об ошибках, сгенерированных ИИ
Компания Apple, подобно многим другим технологическим гигантам, сталкивается с огромным потоком сообщений об ошибках, сгенерированных искусственным интеллектом. Стремясь справиться с этим наплывом, компания внедрила ряд мер для ограничения количества получаемых отчётов, что, однако, вызывает н

Disney+ Premium: Возвращение 4K и HDR после временной утраты
1080p по цене премиум-подписки: стоило ли оно того? Что оставалось подписчикам премиум-тарифа Disney+? Практически ничего. После того как в июне прошлого года исчезла поддержка Dolby Vision, вслед за ней пропали и 4K с HDR10. Эта ситуация вызывала серьёзное недовольство, ведь именно э

ЕС отложил и отменил публикацию спутниковых снимков Оманского залива по запросу США
По запросу Соединенных Штатов, Европейский союз согласился отложить на 24 часа распространение спутниковых снимков со спутников Sentinel 1 и 2, сделанных в регионе Оманского залива. Это решение было мотивировано «безопасностью в интересах Союза». Однако всего две недели спустя ЕС объя

Google Earth приостановил функцию добавления несуществующих объектов (Обновлено)
Обновление: Google объявил о временной приостановке работы инструмента генерации изображений на базе искусственного интеллекта в Google Earth. Это решение было принято после обнаружения, что "некоторые пользователи делились сгенерированными изображениями, которые, по всей видимости, нарушали н

Hugging Face: Проблемы с модерацией недобровольного сексуального ИИ-контента
Hugging Face, крупная платформа, размещающая миллионы моделей искусственного интеллекта (ИИ) и тысячи наборов данных, подвергается критике за отсутствие конкретных инструментов модерации, направленных на предотвращение создания и распространения недобровольного сексуального контента. Согласно и

☕️ Швейцарская Infomaniak готовится к выходу на биржу
Компания Infomaniak активно готовится к своему дебюту на фондовом рынке. Швейцарская фирма заключила соглашение об обратном слиянии с Perrot Duval Holding, еще одной швейцарской компанией с более чем вековой историей (основана в 1905 году). Ожидается, что этот шаг позволит Infomaniak выйти