Представлен новый бенчмарк ALE: ИИ-агенты пока не готовы к реальной работе
Исследователи из Центра ответственного децентрализованного интеллекта (RDI) Калифорнийского университета в Беркли, совместно с консультативным комитетом, включающим более 300 экспертов, представили Agents’ Last Exam (ALE) — новый, крайне требовательный бенчмарк. Его цель — оценить, способны ли современные системы искусственного интеллекта (ИИ) выполнять экономически ценные и длительные профессиональные рабочие процессы.
Неожиданно для многих, модель GPT-5.5 от OpenAI*, выпущенная в апреле, показала лучший результат, функционируя через среду Codex*. Она заняла первое место в новом рейтинге ALE с показателем успешности 24,0%. Таким образом, GPT-5.5 обошла новую модель Claude Fable 5 класса Mythos от Anthropic*, которая была представлена всего лишь вчера и заняла третье место с результатом 22,0%.
ALE разрабатывался не для тестирования моделей на изолированных задачах по программированию, а для сокращения разрыва между ажиотажем вокруг академических бенчмарков и реальным влиянием на трудовую деятельность, имеющую значение для ВВП. Текущие данные показывают, что самые передовые мировые модели фундаментально не справляются с этим экзаменом.
Содержание
Конец эры "жульничества" и неточных систем оценки
Фундаментальное изменение в ALE заключается в его архитектуре оценки и требованиях к ИИ-агенту.
Исторически ИИ-бенчмарки основывались на статичных вопросно-ответных задачах или узких текстовых терминальных средах. Более поздние агентские системы оценки предполагали многоэтапное взаимодействие, но страдали от серьезных проблем с проверкой. Как отмечалось в недавних независимых аудитах старых рейтингов, таких как SWE-Bench Pro, автоматические верификаторы часто отклоняли верные решения. Кроме того, некоторые модели, в частности семейства Claude Opus, были уличены в «мошенничестве», получая доступ к скрытым ключам ответов в истории Git контейнера вместо фактического решения основной задачи.
ALE устраняет эти лазейки, принуждая модели работать в строгих рамках универсального компьютерного агента (Generalist Computer-Use Agent, GCUA). Чтобы пройти тест, агент не может просто выполнять команды в терминале.
Бенчмарк оценивает возможности по пяти функциональным уровням: Мозг (рассуждение), Глаза (визуальное восприятие), Тело (оркестрация), Руки (вызов инструментов) и Ноги (среда выполнения). Агент должен использовать свои «Глаза» и «Руки» для навигации по виртуальным машинам Linux или Windows, чередуя скрипты оболочки с операциями «наведи и нажми» внутри ресурсоемкого настольного программного обеспечения.
Важно отметить, что ALE практически полностью отказывается от непредсказуемой парадигмы оценки «LLM как судья» (когда большая языковая модель используется для проверки ответов), используя ее лишь для 6,8% рабочих процессов. Если задача включает создание 3D-модели или анализ отчётности Комиссии по ценным бумагам и биржам США (SEC), бенчмарк применяет детерминированную оценку на основе кода, чтобы сравнить результат работы агента с эталонным решением эксперта.
Измерение производительности задач в 55 отраслях
ALE запускается с 1490 экземплярами задач и нацелен на достижение 5000 задач. Проект примечателен своей аутентичностью. Задачи строго привязаны к федеральной профессиональной таксономии США (O*NET / SOC 2018) и охватывают 55 нефизических отраслевых подсекторов.
Рабочие процессы напрямую взяты из профессионального опыта отраслевых специалистов. Агентам предлагается выполнять создание 3D-моделей в Siemens NX, настройку сцен в Unreal Engine, анализ нейроизображений в FSLeyes и композитинг визуальных эффектов в Adobe After Effects.
При столкновении с такими подлинными, долгосрочными рабочими процессами ограничения текущего ИИ становятся очевидными. ALE делит свои задачи на три уровня сложности: Ближний горизонт, Полный спектр и Последний экзамен.
Пять лучших агентских сред на доске лидеров ALE
- 1 место | Codex* | gpt-5-5 | 24,0% | 42,8%
- 2 место | Ale Claw | gpt-5-5 | 23,0% | 45,8%
- 3 место | Claude Code | claude-fable-5 | 22,0% | 40,5%
- 4 место | OpenClaw | gpt-5-5 | 21,1% | 41,0%
- 5 место | Cursor CLI | composer-2-5 | 20,4% | 38,5%
Победа GPT-5.5 согласуется с недавним сторонним анализом, который показывает, что модели OpenAI* в настоящее время лучше справляются со строгим соблюдением многосоставных, сложных запросов. И наоборот, пользователи сообщают, что архитектура Claude* от Anthropic* иногда может быть «забывчивой» при работе с многосоставными инструкциями, оставляя без внимания необходимые шаги в середине рабочего процесса — это критический недостаток в строгой системе ALE.
И хотя достижение 24,0% успешности достаточно для получения первого места, абсолютный потолок производительности остается на удивительно низком уровне. На самом сложном уровне «Последний экзамен», представляющем собой границу профессиональной сложности, большинство конфигураций, включая старую Claude* Opus 4.8 от Anthropic* и Gemini* CLI от Google*, показывают крайне низкий показатель успешности в 0,0%.
Решение проблемы заражения бенчмарков
Основная уязвимость в современной оценке ИИ — это «заражение бенчмарков»: явление, при котором тестовые вопросы неизбежно просачиваются в огромные хранилища данных, используемые для обучения моделей следующего поколения. Как только модель запоминает бенчмарк, оценка становится абсолютно бесполезной.
ALE решает эту проблему с помощью стратегии двойного развертывания. Проект функционирует как исследовательская инициатива с открытым исходным кодом, но тщательно охраняет свои оценочные данные. Только около 10% набора данных (примерно 150 задач) публикуются на таких платформах, как GitHub и Hugging Face. Остальные более 1300 задач остаются строго конфиденциальными.
Для разработчиков и корпоративных оценщиков это означает, что ALE функционирует как «живой» бенчмарк. Приватные задачи систематически вводятся в публичный пул с течением времени, в то время как устаревшие публичные задачи выводятся из него. Такой скользящий выпуск гарантирует, что поверхность оценки остается незагрязненной на протяжении сменяющихся поколений моделей, давая корпоративным покупателям уверенность в том, что высокий балл агента заработан, а не заучен.
Кроме того, ALE обеспечивает прозрачность, отслеживая как «Полные», так и «Безлицензионные» оценки. Поскольку реальная профессиональная работа часто требует платного, проприетарного программного обеспечения, «Полный» рейтинг включает задачи, которые зависят от коммерческих САПР-инструментов, платных API или лицензированных наборов данных. «Безлицензионный» уровень исключает эти задачи, требующие лицензии, чтобы обеспечить чистое, сопоставимое сравнение с использованием только свободно доступных инструментов, гарантируя, что модели не вознаграждаются просто за доступ к платному корпоративному программному обеспечению.
Выводы: ALE показывает, что даже самые высокопроизводительные модели нуждаются в улучшении
Для разработчиков, разочарованных разрывом между маркетинговыми заявлениями и фактической производительностью в производственных условиях, жесткая кривая оценки ALE служит важным подтверждением. Цзэнъи Цинь, исследователь из Массачусетского технологического института (MIT) и один из авторов проекта, объявил о запуске на платформе X, поделившись изображениями статьи и впечатляющим списком из более чем 100 учреждений-участников.
По словам Циня, «Представляем Agents’ Last Exam (ALE), созданный более чем 300 экспертами из 100+ учреждений. Он охватывает 55 отраслевых доменов. Claude* Opus 4.8 показал 0,0% успешности на самом сложном подмножестве. Рад, что внес свой вклад в этот бенчмарк». В последующем сообщении, ссылающемся на статью ArXiv на Hugging Face, Цинь добавил, что это «очень солидная работа руководителей проекта @YiyouSun @Xinyang_Han_ @dawnsongtweets и @BerkeleyRDI».
Смотрите также:
Siri предложит пользователям сделать перерыв: в коде iOS 27 обнаружены функции защиты от ИИ-зависимости http://kupidonchik.org/siri-predlozhit-polzovatelyam-sdelat-pereryiv-v-kode-ios-27-obnaruzhenyi-funktsii-zashhityi-ot-ii-zavisimosti/.
Интересности на тему: Sony прекратит поддержку стриминговых сервисов на старых устройствах: Bose показала другой путь
Классные советы в статье "Anthropic представила Claude Fable 5: нейросеть нового поколения для сложных вычислений" здесь.
Поскольку компании инвестируют миллиарды долларов, делая ставку на ИИ-агентов, им отчаянно необходим надежный ориентир. Если агент в конечном итоге сможет преодолеть испытания Agents’ Last Exam, он не просто пройдет тест — он докажет свою готовность присоединиться к рабочей силе. До тех пор неутешительные показатели успешности в рейтинге служат необходимой проверкой реальности для всей экосистемы ИИ.
* — деятельность компании запрещена на территории РФ
