Новая волна конфликта вокруг OpenAI показывает, что главным дефицитом в эпоху искусственного интеллекта становятся не только вычислительные мощности, но и доверие к происхождению научных идей.
Немецкий математик Андреас Том, работающий в области теории групп, публично поставил под вопрос обстоятельства одного из громких результатов внутренней модели Astra.
Речь идет о построении не-софийных групп — результате, который OpenAI представила среди десяти значимых достижений в математике и теоретической информатике.
В собственной публикации компания действительно заявляла, что Astra получила доказательство существования таких групп, однако позднее в описании были уточнены связи результата с более ранними работами Тома и его соавтора Габора Куна.
OpenAI признала, что соответствующее решение опирается на уже существующий корпус исследований, но вопрос о том, какие именно непубличные материалы могли влиять на развитие модели, остался предметом спора.
Том не утверждает, что располагает доказательствами преднамеренного хищения своих результатов. Его претензия существенно точнее и потому принципиальнее: в течение нескольких месяцев он обсуждал с ChatGPT непубликованные математические идеи, относящиеся к близкому техническому направлению, а затем обнаружил, что Astra пришла к похожей, причем не самой очевидной для сообщества линии рассуждений.
Ученый направил представителям OpenAI два разных вопроса: могли ли эти разговоры попасть в обучающие данные и имела ли модель возможность непосредственно обратиться к ним во время решения задачи.
По сообщениям Тома, он получил короткий ответ, который интерпретировал как отрицание прямого доступа, но не как прозрачный ответ о возможном использовании данных в обучающих контурах. Эту позицию подробно передает The Verge.
Именно различие между прямым доступом к частному диалогу и косвенным влиянием обезличенных пользовательских данных стало центральным узлом конфликта.
В параллельном споре вокруг исследований по уравнениям Навье—Стокса OpenAI заявила, что ее сотрудники и агенты не видели конкретную непубличную работу исследователей до публикации. Вместе с тем компания не смогла полностью исключить, что обезличенные данные, полученные в ходе использования ее продуктов, могли способствовать улучшению моделей.
Для математика такая формулировка не снимает тревоги: удаление имени пользователя из текста не удаляет саму идею, доказательный прием или нетривиальную конструкцию. Обезличивание защищает личность, но не обязательно защищает интеллектуальное содержание.
В этом и заключается более широкий риск для фундаментальной науки. Исследователь, вводящий в диалог с моделью черновик статьи, новую гипотезу или промежуточное доказательство, может не понимать, где проходит граница между временным контекстом его сессии, продуктовой телеметрией, хранением данных и потенциальными циклами улучшения модели.
Даже если никаких нарушений не произошло, отсутствие проверяемого и понятного механизма аудита само по себе подрывает доверие. Ученый не способен самостоятельно проследить путь информации внутри закрытого контура обучения, а значит, вынужден принимать гарантии разработчика на веру.
Спор вокруг не-софийных групп важен не как доказательство вины OpenAI, которой на данный момент публично не установлено, а как сигнал о неготовности индустрии к работе с непубликованным научным знанием.
По данным The Verge, Том требует не эмоциональных заверений, а ясного объяснения того, какие данные использовались, какие пользовательские настройки действовали в конкретный период и на чем основывается отрицание возможного влияния диалогов.
Если компании не смогут предложить исследователям воспроизводимые правила происхождения данных, независимый аудит и надежное разделение приватных рабочих материалов с обучающими массивами, ИИ вместо ускорителя открытой науки рискует стать причиной ее нового закрытия.
sms_systems@inbox.ru
+ 7 (985) 982-70-55