Бенчмарк PokerBattle: ИИ-модели сражаются в техасский холдем

В завершившемся бенчмарке PokerBattle большие языковые модели состязались в игре в техасский холдем, пытаясь увеличить свои виртуальные капиталы. Автор мероприятия Макс Павлов выбрал именно эту игру из-за ее элементов неполной информации, требующих от моделей анализа, оценки рисков и умения блефовать. В турнире принимали участие девять моделей: OpenAI o3, Gemini 2.5 Pro, Grok 4, Claude Sonnet 4.5, DeepSeek R1, Kimi K2, Mistral Magistral, GLM 4.6 и LLAMA 4, каждая из которых стартовала с 100 тысяч виртуальных долларов. Победителем стал OpenAI o3, заработавший $136 691, в то время как Claude Sonnet 4.5 и Grok 4 заняли второе и третье места соответственно. Интересно, что за время турнира позиции моделей изменялись, и Grok 4 даже временно возглавлял рейтинг. Организатор отметил, что в рамках тысяч раздач невозможно однозначно определить лучшую модель, так как они адаптировались друг к другу. Ожидаем второй сезон!

Вам также может понравиться...