На фоне гонки за вычислительными мощностями и созданием новых языковых моделей всё заметнее развивается ещё один сегмент ИИ-индустрии — рынок обучающих данных. Компании, которые собирают, размечают, проверяют и поставляют данные для обучения моделей, превращаются из обычных подрядчиков в важных участников разработки ИИ.
По оценкам, приведённым в материале Silicon Observation Pro, 28 стартапов в сфере данных для ИИ уже генерируют совокупно около 8,5 млрд долларов годовой выручки, а их общая оценка приближается к 100 млрд долларов. Особенно быстро растут такие игроки, как Scale AI, Surge AI, Mercor и Handshake. При этом рынок остаётся довольно концентрированным: на несколько крупнейших компаний приходится основная часть доходов отрасли.
Причина такого роста — изменение роли данных. Раньше наборы данных закупались преимущественно под отдельный цикл обучения модели. Теперь модели обновляются гораздо чаще, а разработчикам постоянно требуется новая, узкоспециализированная и качественная информация. Данные превращаются из разовой «сырьевой закупки» в ресурс, который нужен непрерывно.
Одновременно усложняются сами задачи. Если ранние ИИ-модели обучались на относительно простых примерах — например, небольших исправлениях кода, — то современные агенты должны понимать рабочие процессы, работать с несколькими файлами, проверять результаты и самостоятельно выполнять последовательность действий. Это повышает ценность одного обучающего примера: вместо короткой инструкции он может содержать целый сценарий решения реальной задачи.
Особый спрос формируется на данные из настоящей профессиональной среды: документы, таблицы, презентации, программный код, медицинские записи, рабочую переписку и бизнес-процессы. Такие сведения сложнее получить из-за требований к конфиденциальности, правам на использование и обезличиванию. Поэтому появляются компании-посредники, которые помогают организациям легально и безопасно превращать внутренние данные в материалы для обучения ИИ.
Ещё одно перспективное направление — среды для обучения с подкреплением. Это не статические наборы примеров, а цифровые «тренажёры», где модель может выполнять действия, ошибаться, получать обратную связь и постепенно учиться решать задачи. Например, для офисных ИИ-агентов создаются симуляции Excel, CRM-систем, корпоративных мессенджеров и сервисов поддержки клиентов.
В результате рынок постепенно уходит от простой разметки данных. Компании стремятся участвовать во всей цепочке создания ИИ: оценивать слабые стороны моделей, проектировать задания, привлекать профильных экспертов, создавать обучающие среды и подтверждать улучшение результата. Именно поэтому данные для ИИ всё чаще рассматриваются не как вспомогательная услуга, а как самостоятельная технологическая индустрия с очень высокой стоимостью.
sms_systems@inbox.ru
+ 7 (985) 982-70-55