Frontier Labs OpenAI заявили о решении сотен сложнейших математических задач и опубликовали множество доказательств. Однако независимая комиссия Advisory Group on Mathematics and Artificial Intelligence (AGMAI), собранная при Принстонском институте передала рекомендации общественности с оговоркой — результатами должны заняться профессиональные математики и сообщество, а не только тестирование на проприетарной модели. В заявлении AGMAI подчёркнули, что в конечном счёте именно математическое сообщество оценивает, насколько их рекомендации выполнимы на практике.

Среди сложностей подчеркивается необходимость человеческого понимания математического вывода. Новый спорный набор решений совпал с выводами в новой статье, где отмечены пропуски между языковым объяснением и формальным выражением доказательства, что ставит под сомнение статус одного из проектов OpenAI как миллион-долларовую задачу. По мнению критиков, это демонстрирует слабую связь между тем, как модель формулирует решение на естественном языке, и тем, как проверяют его формализацией.

AGMAI состоит из девяти ведущих исследователей со всего мира. В конце сентября организация опубликовала принципы для frontier labs, признав, что оценка выполненности рекомендаций — задача математического сообщества. В то же время AGMAI настаивает на запрете тестирования продвинутых математических проблем на проприетарных моделях и на том, что OpenAI следует поддержать работу человека-математика для придания смысловой ценности решениям.

По итогам обсуждений организаторы пояснили, что часть выводов модели была выпущена с пояснениями о ходе рассуждений, однако таких материалов оказалось немного — только десять из 719 рукописей содержали цепочку рассуждений модели. При этом AGMAI подчеркнули, что для материалов, которые аудиторию трудно понять, эксперты рекомендовали формализацию доказательства, но только 42% опубликованных OpenAI работ прошли этот процесс.

Критики указывают на проблемы с тем, как автоматизированные модели переводят естественно-языковое доказательство в код на Lean, который должен формализовать доказательство. Исследование, проведённое учёными из Кембриджа и King’s College, выявило как минимум две несоответствия между текстовым выводом и Lean-кодом в решении задачи, связанной с уравнениями Навье–Стокса. Это не обязательно опровергает оба решения, но вызывает вопросы о возможности полагаться на автоматизированные решения без участия человека. Авторы исследования настояли на внедрении метаданных, связывающих язык и формальные артефакты.

В итоге AGMAI заявила, что важно, чтобы люди несли ответственность за результаты и участвовали в распространении открытых материалов через статьи, доклады и семинары. По мнению критиков, такой процесс способствует лучшему пониманию решений и применению новых знаний в практических областях. По словам математика Гарвардского университета Мелани Вуд, при запросе к решению трудной задачи человек ещё должен приступить к дальнейшей работе над выводами и их осмыслением.