Модели GPT-5 и Gemini 2.5 Pro продемонстрировали выдающиеся результаты на олимпиаде по астрономии

Модели искусственного интеллекта, такие как GPT-5 и Gemini 2.5 Pro, достигли результатов, соответствующих уровню «золота» в рамках Международной олимпиады по астрономии и астрофизике (IOAA). Исследователи провели тестирование крупных языковых моделей на задачах, составленных для олимпиад 2022–2025 годов, и оценили их ответы, следуя официальным критериям. Примечательно, что набор задач IOAA-2025 был разработан совсем недавно, в августе 2025 года, что свидетельствует о том, что модели не использовали заранее подготовленные ответы, а решали задачи с нуля. В эксперименте рассматривались теоретический тур и анализ данных, при этом оценка решений была проведена в условиях, близких к настоящей олимпиаде. В среднем, GPT-5 показал 84,2% в теории и 88,5% в анализе данных, тогда как Gemini 2.5 Pro — 85,6% и 75,7% соответственно. Другие модели, такие как OpenAI o3 и Claude, также демонстрировали высокие результаты, однако их успехи в анализе данных были менее стабильными. Основные ошибки моделей заключались в концептуальных аспектах, таких как геометрия и интерпретация графиков. Авторы исследования предлагают улучшение мультимодальности как следующий шаг в развитии моделей.

Вам также может понравиться...