Результаты эксперимента Cursor по масштабированию автономных кодинг-агентов

Разработчики компании Cursor представили результаты масштабного эксперимента с автономными кодинг-агентами. В рамках проекта были задействованы сотни агентов, которые работали параллельно в течение нескольких недель, написав свыше миллиона строк кода. Основной задачей было выяснить, возможно ли ускорить решение задач, которые традиционно занимают месяцами у команд разработчиков.

Однако, основным вызовом оказалась координация работы агентов. При равном статусе и самостоятельном распределении задач, лишь двадцать из них показывали продуктивность двух-трех, в то время как остальные ждали освобождения блокировок. Без иерархии агенты уклонялись от сложных задач, выполняя лишь простые правки. В результате была внедрена система ролей: планировщики исследуют код и формируют задачи, в то время как воркеры занимаются их выполнением и отправкой изменений.

Для тестирования новой модели агенты на базе GPT-5.2 были задействованы для создания браузера с нуля. За неделю они сгенерировали свыше трех миллионов строк кода, включая движок рендеринга на Rust. По словам CEO Cursor, Майкла Труэлла, браузер справляется с простыми сайтами достаточно быстро, хотя до уровня WebKit и Chromium еще далеко.

При этом GPT-5.2 показала лучшие результаты в долгосрочных автономных задачах, сохраняя фокус и следуя инструкциям. Команда сделала важный вывод: качество промптов важнее выбора модели или архитектуры системы. Несмотря на то, что система требует оптимизации, эксперименты продемонстрировали, что масштабирование действительно возможно.

Вам также может понравиться...