Ещё один математик обвинил OpenAI в непрозрачности происхождения обучающих данных
Математик Андреас Том публично заявил, что его переписка с ChatGPT могла способствовать результату OpenAI по несофическим группам, назвав ответы компании о происхождении данных вводящими в заблуждение.

Ещё один математик открыто выступил против OpenAI, поставив под сомнение происхождение данных, лежащих в основе недавней серии заявленных компанией математических достижений. Через несколько дней после скандала о том, использовали ли модели OpenAI неопубликованные исследования других учёных, Андреас Том в Mastodon обвинил компанию в нечестности и отсутствии прозрачности.
Область работы самого Тома — несофические группы, бесконечные математические структуры, которые невозможно приблизить конечными, — стала темой одного из десяти результатов, о которых OpenAI с большой помпой объявила в прошлом месяце. Изначально компания не упомянула недавние работы Тома и его коллеги Габора Куна, но после критики со стороны математического сообщества незаметно доработала публикацию.
Том начал переосмысливать собственное взаимодействие с ChatGPT после того, как профессор Нью-Йоркского университета Тристан Бакмейстер публично задался вопросом, не использовались ли его наработки в Codex. Тома поразило, насколько детально система OpenAI владела именно теми приёмами, которые на тот момент не были ни очевидными, ни самыми перспективными. Он написал исследователям OpenAI Себастьяну Бубеку и Марку Селке с вопросом, попали ли его разговоры с ChatGPT в обучающие данные или были ли доступны процессу рассуждения модели.
Полученный ответ, по словам Тома, касался лишь того, можно ли напрямую получить доступ к его беседам, но не того, были ли они включены в обширные массивы данных, используемые компанией для обучения моделей. Том подчеркнул, что отдельные учёные не в состоянии самостоятельно проверить внутренний процесс обучения OpenAI, и ответственность за доказательство неиспользования таких данных лежит на самой компании.
Подобная двусмысленность прослеживается и в объяснениях OpenAI по поводу заявленного решения одной из проблем тысячелетия — уравнений Навье–Стокса. Компания отрицала прямой доступ к неопубликованным работам конкретных пользователей, но не исключила, что деидентифицированные данные из их использования продуктов могли косвенно улучшить модели. Том отметил, что деидентификация убирает имя, но не суть математической идеи.
OpenAI не ответила на запрос The Verge о комментарии. Инцидент вызвал тревогу среди математиков, которые опасаются, что подобная практика подтолкнёт исследователей к большей закрытости — из страха, что даже слухи о близком прорыве могут спровоцировать гонку с хорошо финансируемой технологической компанией.


