Заголовки

METR оценил возможности Claude Opus 4.6 в новом бенчмарке

Организация METR представила результаты оценки модели Claude Opus 4.6 по бенчмарку Time Horizon 1.1, определяющему сложность задач для ИИ. Конкретно, новая модель от Anthropic продемонстрировала 50%-й временной горизонт в 14,5 часа, что соответствует времени, необходимому экспертам для решения заданной задачи с вероятностью 50%. Ранее рекорд принадлежал GPT-5.2 (high) с показателем 6 часов 34 минуты. Однако исследователи отметили, что на эти результаты полагаться нельзя: 95%-й доверительный интервал колебался от 6 до 98 часов, что делает верхнюю границу более продолжительной, чем любая задача из тестов. Проблема заключается в том, что новые модели решают задачи слишком быстро, затрудняя экстраполяцию. На горизонте 80% Opus 4.6 также оказался лидером, но с меньшим отрывом — 1 час 3 минуты по сравнению с 55 минутами у GPT-5.2 (high). С обновлением бенчмарка в январе добавлено 34% новых тестов, но скорость прогресса моделей превышает темпы создания новых испытаний.