Продакт-менеджер исследовательской команды Anthropic Теодора Чу (Theodora Chu) рассказала о том, как меняется роль больших языковых моделей в разработке программного обеспечения. По ее словам, Claude уже перестал быть просто инструментом для генерации кода и становится полноценным участником инженерного процесса.
Одним из самых заметных фактов стало заявление о том, что сегодня более 80% изменений, попадающих в кодовую базу Anthropic, создаются с помощью Claude. При этом речь идет не о полностью автономной разработке: модель помогает писать код, однако итоговые проверки и интеграция изменений по-прежнему находятся под контролем команды разработчиков.
По словам Чу, главным отличием современных AI-агентов становится способность работать в замкнутом цикле — не только выполнять задачу, но и самостоятельно проверять результат, получать обратную связь, исправлять ошибки и продолжать работу до достижения нужного результата. В компании называют такой подход «Close the Loop» («замкнуть цикл»).
Anthropic отмечает, что за последний год возможности моделей заметно выросли. Внутренние оценки показывают значительное улучшение результатов на тестах по программной инженерии. При этом разработчики считают более важным не рост итоговых баллов, а снижение числа ошибок, поскольку именно это позволяет поручать моделям более продолжительные и сложные задачи.
По наблюдениям компании, современные модели также лучше справляются с планированием работы. Если предыдущие поколения часто сразу приступали к написанию кода, то новые версии сначала анализируют задачу, строят план действий и лишь затем начинают реализацию. Такой подход позволяет уменьшить количество лишних действий и повторных исправлений.
Еще одним важным изменением стала способность моделей восстанавливаться после ошибок. Ранее AI нередко попадал в так называемый «цикл повторения», когда после неудачи многократно пытался использовать один и тот же неэффективный способ решения. Теперь модели лучше анализируют причины неудач и способны выбирать альтернативные стратегии.
Кроме того, современные системы значительно увереннее работают с большими объемами информации. Это позволяет передавать модели целые проекты или крупные фрагменты кода вместо отдельных файлов, сохраняя целостное понимание задачи на протяжении длительной работы.
На основе этого опыта Anthropic рекомендует разработчикам пересмотреть подход к созданию AI-продуктов. В частности, компания советует регулярно обновлять собственные системы оценки качества моделей, поскольку задачи, которые были сложными год назад, сегодня уже могут не отражать реальные возможности современных ИИ.
Еще одна рекомендация касается так называемых «строительных лесов» (scaffolding) — большого количества дополнительных инструкций, ограничений и вспомогательной логики, которыми разработчики окружали ранние модели. По мере роста возможностей ИИ такие конструкции могут не только перестать приносить пользу, но и ухудшать результаты, поэтому их стоит постепенно упрощать.
Наконец, в Anthropic считают, что наиболее эффективные AI-агенты должны иметь возможность самостоятельно проверять результаты своей работы. Для этого модели необходимо предоставить доступ к инструментам тестирования, взаимодействию с интерфейсом приложения и другим механизмам, позволяющим оценивать качество выполненной задачи без постоянного участия человека.
По мнению компании, именно сочетание планирования, самопроверки, исправления ошибок и длительной автономной работы станет основой следующего поколения интеллектуальных программных агентов, способных выполнять все более сложные задачи в реальной среде разработки.
sms_systems@inbox.ru
+ 7 (985) 982-70-55