Модель GPT-6 Astra заняла первое место в тесте Vending-Bench 2, где ИИ-агенты самостоятельно управляют виртуальным бизнесом по продаже товаров через торговый автомат.
По условиям эксперимента каждому агенту предоставлялись 500 долларов стартового капитала и один симулированный год для поиска поставщиков, переговоров о закупочных ценах, пополнения запасов и определения розничных цен.
Согласно опубликованным Andon Labs результатам, средний итоговый баланс GPT-6 Astra составил 15 515 долларов, тогда как Claude Fable 5.1 показала средний результат в 5 422 доллара.
При этом худший результат Astra оказался выше лучшего результата конкурирующей модели. Важно учитывать, что сравнивался именно конечный баланс на счёте, а не чистая прибыль, поэтому эти показатели не следует напрямую интерпретировать как доходность бизнеса.
Ключевым преимуществом Astra стала способность сохранять первоначальные правила принятия решений в долгосрочном сценарии. В частности, модель удерживала низкие закупочные ориентиры и не позволяла временно завышенным ценам поставщиков становиться новой нормой для переговоров.
В одном из примеров Astra сократила предложение поставщика по закупке набора напитков и снеков примерно на 52%, сохранив требуемый объём поставки.
Не менее важной оказалась дисциплина в работе с платежами. В симуляции поставщики могли прекращать деятельность, поэтому перечисление денег без актуального подтверждения заказа создавало риск невозвратных потерь.
Astra, по приведённым данным, почти всегда проверяла новые сообщения поставщика перед повторной оплатой. У Claude Fable 5.1 таких проверок было существенно меньше, что приводило к ошибочным предоплатам и накоплению убытков.
Дополнительный многопользовательский тест показал, что Astra также смогла успешно действовать в конкурентной среде, где агенты боролись за покупателей, обменивались сообщениями и могли торговать запасами.
Модель выиграла все три проведённые конкурентные сессии, избегая ценовых договорённостей с соперниками и сохраняя независимую коммерческую стратегию.
Результаты Vending-Bench 2 не доказывают, что ИИ уже способен надёжно вести реальный бизнес в течение года: симуляция неизбежно ограничена заданными правилами и не отражает всей сложности настоящего рынка.
Тем не менее тест демонстрирует важную тенденцию для развития ИИ-агентов. Их качество всё больше определяется не разовой точностью ответа, а умением долго сохранять цели, учитывать последствия прежних действий, соблюдать ограничения и превращать корректные решения в последовательное исполнение.
sms_systems@inbox.ru
+ 7 (985) 982-70-55