Gemini 3 Flash не справилась с фудтрак-симуляцией

Авторы проекта FoodTruck Bench, где ИИ-модели управляют фудтраком в Остине на протяжении 30 дней, обнаружили, что Gemini 3 Flash не справляется с симуляцией. В 5 из 7 запусков модель застревала в бесконечном цикле и не выполняла никаких действий. В то время как такие модели, как GPT-5, Claude, DeepSeek и Gemini Pro, успешно завершали задачу без ошибок.

Ситуация повторялась: в нулевой день все шло гладко — 13 вызовов инструментов за 44 секунды. Однако на первом дне, когда требовалось принять решения о закупках и местоположении, ответ модели достигал 174 816 символов, включая 574 повтора фразы «Let’s go», но без вызовов инструментов.

При перезапуске симуляции Gemini 3 Flash отвечала корректно, но вскоре снова застревала — модель бесконечно добавляла одни и те же ингредиенты к заказу, что могло бы привести к банкротству в реальном бизнесе. Парадоксально, но в стандартном режиме модель показала хорошие результаты, заработав $8 703 за 15 дней без сбоев. Проблемы возникают только при активном размышлении, что авторы бенчмарка назвали «параличом анализа». Ни одна из протестированных 16 моделей не проявила подобного поведения, и Gemini 3 Flash была исключена из рейтинга из-за неработоспособности в симуляции.

Вам также может понравиться...