Anthropic признала ошибку в использовании скрытых ограничений для Claude Fable 5

Anthropic признала ошибку в использовании скрытых ограничений для Claude Fable 5

Компания Anthropic официально извинилась за внедрение секретных механизмов, которые искусственно ограничивали возможности новой флагманской нейросети Claude Fable 5. Эти «невидимые барьеры» были разработаны для защиты от конкурентов, однако они негативно повлияли на работу исследователей и обычных пользователей. Разработчики пообещали изменить подход и сделать работу защитных алгоритмов прозрачной.

Проблема «невидимой» защиты и дистилляции моделей

Claude Fable 5 стала первой доступной моделью из семейства Mythos — группы ИИ-систем, которые Anthropic долгое время считала слишком мощными для публичного релиза. Чтобы минимизировать риски, компания внедрила систему защиты от дистилляции — метода обучения малых нейросетей на основе ответов более крупных и совершенных моделей. Разработчики опасались, что конкуренты будут использовать Claude для улучшения своих систем.

В технической документации к модели отмечалось, что при обнаружении попыток дистилляции нейросеть будет намеренно выдавать упрощенные или искаженные ответы. Главная проблема заключалась в том, что пользователи не получали никаких уведомлений об активации этого режима. Это создавало ложное впечатление о снижении общего качества работы ИИ без объяснения причин.

Переход к прозрачным алгоритмам безопасности

В ответ на критику экспертного сообщества Anthropic объявила о смене стратегии. Теперь вместо скрытого ухудшения качества ответов компания внедряет следующие правила:

  • При срабатывании фильтров безопасности запрос будет автоматически перенаправляться на предыдущую флагманскую модель — Claude Opus 4.8.
  • Пользователь будет видеть уведомление о том, что система переключилась на другую версию модели из-за ограничений безопасности.
  • Аналогичный подход будет применяться в таких чувствительных сферах, как биология, химия и кибербезопасность.

Обозреватели отмечают, что ранее настройки безопасности в области биологии были настолько строгими, что модель отказывалась отвечать даже на самые простые и безобидные вопросы. В Anthropic признали, что скрытые фильтры было проще внедрить для быстрого запуска, но это стало «неправильным компромиссом» в вопросах доверия пользователей.

Контекст борьбы с конкурентами

Смотрите также:

Пользователи Android назвали лучшее приложение для изучения иностранных языков http://kupidonchik.org/polzovateli-android-nazvali-luchshee-prilozhenie-dlya-izucheniya-inostrannyih-yazyikov/.

Интересности на тему: Рекордные скидки на Amazon: лучшие предложения до старта Prime Day

Классные советы в статье "Глава Microsoft AI прояснил влияние искусственного интеллекта на «белых воротничков»" здесь.

Решение Anthropic защитить свои наработки последовало после серии инцидентов в индустрии. В частности, компанию DeepSeek и других китайских разработчиков ранее обвиняли в использовании данных Claude для обучения своих алгоритмов в «промышленном масштабе». Представители Anthropic напомнили, что использование их сервисов для создания конкурирующих моделей напрямую нарушает условия обслуживания.

Несмотря на извинения, компания подчеркнула, что продолжит защищать свою интеллектуальную собственность, но теперь будет делать это открыто, предоставляя пользователям информацию о том, как и почему ограничиваются возможности нейросети.