GPT-6 Astra показала сильный результат в симуляции автономного управления бизнесом

GPT-6 Astra показала сильный результат в симуляции автономного управления бизнесом
 

Модель GPT-6 Astra заняла первое место в тесте Vending-Bench 2, где ИИ-агенты самостоятельно управляют виртуальным бизнесом по продаже товаров через торговый автомат.

По условиям эксперимента каждому агенту предоставлялись 500 долларов стартового капитала и один симулированный год для поиска поставщиков, переговоров о закупочных ценах, пополнения запасов и определения розничных цен.

Согласно опубликованным Andon Labs результатам, средний итоговый баланс GPT-6 Astra составил 15 515 долларов, тогда как Claude Fable 5.1 показала средний результат в 5 422 доллара.

При этом худший результат Astra оказался выше лучшего результата конкурирующей модели. Важно учитывать, что сравнивался именно конечный баланс на счёте, а не чистая прибыль, поэтому эти показатели не следует напрямую интерпретировать как доходность бизнеса.

Ключевым преимуществом Astra стала способность сохранять первоначальные правила принятия решений в долгосрочном сценарии. В частности, модель удерживала низкие закупочные ориентиры и не позволяла временно завышенным ценам поставщиков становиться новой нормой для переговоров.

В одном из примеров Astra сократила предложение поставщика по закупке набора напитков и снеков примерно на 52%, сохранив требуемый объём поставки.

Не менее важной оказалась дисциплина в работе с платежами. В симуляции поставщики могли прекращать деятельность, поэтому перечисление денег без актуального подтверждения заказа создавало риск невозвратных потерь.

Astra, по приведённым данным, почти всегда проверяла новые сообщения поставщика перед повторной оплатой. У Claude Fable 5.1 таких проверок было существенно меньше, что приводило к ошибочным предоплатам и накоплению убытков.

Дополнительный многопользовательский тест показал, что Astra также смогла успешно действовать в конкурентной среде, где агенты боролись за покупателей, обменивались сообщениями и могли торговать запасами.

Модель выиграла все три проведённые конкурентные сессии, избегая ценовых договорённостей с соперниками и сохраняя независимую коммерческую стратегию.

Результаты Vending-Bench 2 не доказывают, что ИИ уже способен надёжно вести реальный бизнес в течение года: симуляция неизбежно ограничена заданными правилами и не отражает всей сложности настоящего рынка.

Тем не менее тест демонстрирует важную тенденцию для развития ИИ-агентов. Их качество всё больше определяется не разовой точностью ответа, а умением долго сохранять цели, учитывать последствия прежних действий, соблюдать ограничения и превращать корректные решения в последовательное исполнение.

БОЛЬШЕ ИНФОРМАЦИИ

Email

sms_systems@inbox.ru

Телефон

+ 7 (985) 982-70-55

Если у вас есть инновационная идея, мы будем рады реализовать ее для Вас!

Специалисты нашей кампании и наши разработки для вас!