Разработчики компании Cursor опубликовали результаты масштабного эксперимента, в котором они запускали одновременно сотни автономных кодинг-агентов на одном проекте. Эти агенты работали в течение нескольких недель и создали более миллиона строк кода, стремясь выяснить, возможно ли ускорить процесс разработки, который обычно занимает месяцы. Однако основной проблемой стала координация: когда агенты получили равные права и начали самостоятельно распределять задачи, лишь двадцать из них показывали эффективность двух-трех. Остальные ждали освобождения ресурсов. В итоге, внедрение иерархии и разделение ролей между планировщиками и исполнителями позволило значительно улучшить процесс. В качестве теста агенты на базе GPT-5.2 были задействованы для создания браузера с нуля. В результате они сгенерировали свыше трех миллионов строк кода за неделю. Несмотря на то, что браузер успешно обрабатывает простые сайты, до уровня WebKit или Chromium ему еще предстоит дорасти. Интересно, что GPT-5.2 показала лучшие результаты для длительных автономных задач, сохраняя концентрацию и следуя инструкциям, в отличие от других моделей, таких как Opus 4.5. Главный вывод команды заключается в том, что правильные промпты важнее выбора модели или архитектуры системы.