Результаты тестирования модели Claude Opus 4.5 от Anthropic
Организация METR, занимающаяся оценкой возможностей ИИ-моделей, обнародовала результаты тестирования Claude Opus 4.5, разработанной компанией Anthropic. Эта модель достигла рекорда с 50%-горизонтом в 4 часа 49 минут, что значительно превышает предыдущие достижения, в частности, модель GPT-5.1-Codex-Max от OpenAI, которая показывала 2 часа 53 минуты. METR фокусируется не на точности ответов, а на длине задач, которые ИИ может выполнять самостоятельно. За последние годы этот показатель увеличился вдвое примерно каждые 7 месяцев. Исследователи предупреждают о необходимости осторожного подхода к интерпретации результатов, так как доверительный интервал составляет от 1 часа 49 минут до 20 часов 25 минут. При более строгих критериях успеха, 80%, горизонт Opus 4.5 сокращается до 27 минут. К концу десятилетия предполагается, что ИИ сможет выполнять проекты длительностью в месяц, однако критики указывают на ограничения текущего тестового набора.