Результаты оценки Claude Opus 4.6 от METR вызвали вопросы о достоверности
Организация METR представила итоги оценки Claude Opus 4.6 по бенчмарку Time Horizon 1.1, который анализирует сложность задач, доступных ИИ-агентам. Модель Anthropic продемонстрировала 50%-й временной горизонт, равный 14,5 часам — это время, за которое модель с вероятностью 50% может решить задачу, эквивалентную 14,5 часам работы человека-эксперта. Ранее рекорд принадлежал GPT-5.2 с показателем 6 часов 34 минуты. Однако исследователи предупредили о ненадежности этой цифры: 95%-й доверительный интервал варьируется от 6 до 98 часов, что ставит под сомнение точность экстраполяции результатов. В обновленной версии тестов добавлено 34% новых задач, но модели развиваются быстрее, чем исследователи создают новые испытания. MIT Technology Review назвала график METR «самым неправильно понимаемым графиком в ИИ», то есть 14,5 часов обозначают не непрерывную работу, а эквивалент времени для человека-эксперта. Кроме того, задачи ограничены сферой программирования, ML и кибербезопасности, что делает их менее репрезентативными для реальной работы.