Создан новый экзамен для проверки границ ИИ
Международная команда экспертов разработала новый экзамен Humanity's Last Exam для объективной оценки возможностей ИИ, включающий задания, с которыми современные модели пока не справляются. Первые тесты показали, что даже самые продвинутые ИИ-системы далеки от человеческого уровня, а человеческая экспертиза остаётся незаменимой.
Crius
По мере того как искусственный интеллект начал демонстрировать высокие результаты на традиционных академических тестах, возникла новая задача: прежние испытания, ранее считавшиеся сложными для машин, больше не позволяют объективно оценивать возможности современных ИИ-моделей. Например, экзамен Massive Multitask Language Understanding (MMLU), ранее считавшийся сложным, теперь не отражает реальный уровень развития передовых систем.
Разработка нового теста для ИИ
Для решения этой проблемы международная команда из почти тысячи специалистов, включая представителей Техасского университета A&M, создала новый тип экзамена — Humanity's Last Exam (HLE). Этот тест состоит из 2500 вопросов, охватывающих математику, гуманитарные и естественные науки, древние языки и специализированные академические дисциплины. Экзамен был разработан так, чтобы включать задания, с которыми современные ИИ-системы пока не справляются. Подробная информация о проекте опубликована в журнале Nature и на сайте lastexam.ai.
Особенности Humanity's Last Exam
В создании и доработке вопросов принимали участие эксперты из разных областей. Каждый вопрос был тщательно сформулирован, чтобы иметь однозначный и проверяемый ответ, а также чтобы его нельзя было быстро решить с помощью простого поиска в интернете. Темы заданий включают перевод древних надписей, идентификацию анатомических структур у птиц и анализ особенностей произношения библейского иврита.
Процесс отбора вопросов
Каждый вопрос тестировался на ведущих ИИ-системах. Если какая-либо модель могла правильно ответить на вопрос, он исключался из финального экзамена. Такой подход позволил создать тест, который остается сложнее того, что современные ИИ могут надежно решить.
Результаты тестирования
Первые испытания показали, что даже самые мощные ИИ-модели испытывают трудности с этим экзаменом. Например, GPT-4o набрал 2,7%, Claude 3.5 Sonnet — 4,1%, OpenAI o1 — 8%. Наиболее продвинутые системы, такие как Gemini 3.1 Pro и Claude Opus 4.6, достигли точности от 40% до 50%.
Необходимость новых тестов
Высокие баллы на тестах, изначально созданных для людей, не всегда свидетельствуют о настоящем интеллекте ИИ. Такие тесты в основном измеряют способность выполнять конкретные задачи, а не глубину понимания. Без точных инструментов оценки разработчики и пользователи могут неправильно интерпретировать возможности ИИ-систем. Бенчмарки необходимы для объективного измерения прогресса и выявления рисков.
Долгосрочная цель и структура теста
Humanity's Last Exam задуман как устойчивый и прозрачный инструмент для оценки будущих ИИ-систем. Для предотвращения заучивания ответов моделями часть вопросов опубликована, а большинство остаётся скрытыми.
Международное сотрудничество
Проект объединил экспертов из разных стран и дисциплин, включая специалистов по компьютерным наукам, истории, физике, лингвистике и медицине. Такое разнообразие позволило выявить пробелы современных ИИ-систем и подчеркнуло важность человеческой экспертизы в создании сложных задач.
Значение теста
Humanity's Last Exam не ставит целью заменить человека или создать угрозу, а служит инструментом для объективной оценки границ искусственного интеллекта. Экзамен подчеркивает, что несмотря на технологический прогресс, существует значительный разрыв между возможностями ИИ и человеческим интеллектом, а человеческая экспертиза по-прежнему играет ключевую роль.
