GPT-6 Astra и миф об AGI: почему рекордные бенчмарки не доказывают общий интеллект
Представители OpenAI утверждают, что недавний запуск одной из её новейших моделей, GPT-6 Astra, знаменует начало эры искусственного общего интеллекта (AGI) — гипотетического сценария, в котором искусственный интеллект (ИИ) может учиться и рассуждать как человек. После недавних заявлений технологических руководителей о том, что мы достигли этой вехи, насколько вероятно, что это утверждение выдержит проверку?
На фоне разоблачений о том, что опасения по безопасности вынудили компанию отказаться от запланированного выпуска GPT-6.1 Astra, независимые исследователи и создатели бенчмарков предупреждают, что рекордные результаты GPT-6 Astra rely на тяжёлую оптимизацию промптов, а не на истинный общий интеллект. Это происходит на фоне предупреждений экспертов о рисках будущих ИИ-систем и совместных призывов ИИ-руководителей к замедлению исследований в области ИИ.
Заявления OpenAI
Объявляя о выпуске модели, президент OpenAI Грег Брокман предположил, что Astra сигнализирует о фундаментальном поворотном моменте в эволюции ИИ. «Если мы перенесёмся на пару лет вперёд и оглянемся назад, и спросим, когда же действительно был создан AGI, я думаю, это будет примерно это время, и я думаю, это может быть примерно эта модель», — сказал Брокман на пресс-конференции 3 сентября, посвящённой запуску.
Как новая модель показала себя в бенчмаркинге?
В рамках процесса тестирования и верификации новой модели OpenAI опубликовала результаты бенчмарков по ряду тестов, измеряющих возможности ИИ-моделей в различных задачах. Представители OpenAI заявили в заявлении, что новая модель компании обеспечивает «передовую в отрасли» производительность в различных областях, включая программную инженерию, автономное использование компьютерных программ, математические задачи и даже научные исследования.
Демонстрации, например, подчеркнули способность Astra генерировать 3D CAD-код; размещать печатные платы в CAD-программах; преобразовывать цифровые 3D-модели в интерактивные среды в стиле видеоигр; и развёртывать hosted веб-приложения непосредственно из промптов.
На ARC-AGI-3 — бенчмарке, designed для измерения того, насколько эффективно ИИ-системы приобретают новые навыки в новых, абстрактных средах, — Astra достигла headline-результата 99,9%. Независимое тестирование некоммерческим Фондом ARC Prize, который курирует бенчмарк, показало, что Astra превзошла базовые показатели «человеческой эффективности действий» на 96% уровней, затрачивая в среднем на 51,7% меньше действий на уровень, чем человеческие решатели.
Насколько можно доверять результатам тестов?
Многие исследователи подчеркнули, что лучшая производительность Astra на ARC-AGI-3 rely на проприетарный «Provider Adapter» — специализированный слой программного обеспечения, недоступный конкурентам. При тестировании с использованием нейтрального Standard harness бенчмарка этот результат упал до 62,7%. Организаторы ARC Prize также отметили, что насыщение бенчмарка не является доказательством достижения AGI — подчёркивая, что его закрытые, детерминированные головоломные среды не отражают открытую сложность реального мира.
«Когда мы запускали ARC-AGI-3, мы ясно дали понять, что насыщение бенчмарка не будет представлять «доказательство достижения AGI»», — написал Камрадт в блоге. «Поэтому, хотя мы считаем, что Astra представляет значительный прогресс в направлении обобщения, мы не утверждаем, что это AGI».
Расхождения в данных, как сообщается, присутствовали ещё до официального объявления. Как сообщил Fortune, черновик, предоставленный новостным организациям до запуска модели, указывал результат Astra на ARC-AGI-3 в 98,6%, прежде чем он подскочил до 99,9% на живом сайте. Анка Реуэль и Майк Харди, докторанты-исследователи в области ИИ в Стэнфордском университете, также выразили concern по поводу того, что OpenAI тихо пересмотрела несколько опубликованных метрик после запуска, включая сокращение заявленного уровня галлюцинаций Astra вдвое с 4,2% до 2,0%, прежде чем вернуть его обратно.
В разговоре с Fortune Реуэль и Харди приписали меняющиеся цифры «benchmaxxing» — отраслевому термину, описывающему практику многократного перезапуска оценок с тонко настроенными промптами, harness или вычислительными allocations для поиска пиковых теоретических результатов. В статье 2025 года, опубликованной на сервере препринтов arXiv под названием «Benchmarking is Broken — Don’t Let AI be its Own Judge», эксперты, включая докторанта Принстона Цзеруи Чэна и постдокторанта Люксембургского университета доктора Стеллу Вониг, предупредили, что такие практики создают путаницу и подрывают доверие, особенно когда официальная техническая документация опускает базовую методологию, делая независимую проверку почти невозможной. Ключевой момент: результаты, достигнутые через benchmaxxing, отражают идеализированные потолки производительности в оптимальных лабораторных условиях, а не практическую надёжность «из коробки».
Противоречивые данные
Согласно данным бенчмарков OpenAI, по специализированным доменным оценкам GPT-6 Astra обеспечила на 10–20% лучшую производительность, чем как её предшественник GPT-5.6 Sol, так и ведущие рыночные конкуренты. Основные моменты включают 98% на FrontierMath Tier 4 (v2); идеальные 100% на ExploitBench; 95,9% на BenchCAD; 57,9% на Terminal-Bench 4.0; и 41,4% на AutomationBench.
Но независимые findings от внешней фирмы по бенчмаркингу ИИ Artificial Analysis противоречат этим результатам. Результат Astra по независимому Индексу интеллекта Artificial Analysis — агрегированной метрике, оценивающей общее рассуждение across frontier-моделей, — остался совершенно плоским, на уровне 61, по сравнению с GPT-5.6 Sol, при этом отставая от конкурентов, таких как Claude Fable 5.1 от Anthropic и Muse Spark 1.3 от Meta.
Хотя некоторые результаты бенчмарков улучшились по сравнению с предыдущим поколением, Astra показала худшие результаты в других тестах. Тестирование Artificial Analysis показало, что против GDPval-AA v2 Astra потерпела значительное падение в относительном рейтинге лидерборда по сравнению с GPT-5.6 Sol. Дополнительные регрессии наблюдались в бенчмарках, тестирующих поддержку клиентов, научное программирование на Python и рассуждение с длинным контекстом across больших документов.
Эффективность токенов и стоимость
Что касается общего использования токенов, представители OpenAI сказали, что GPT-6 Astra достигла драматических gains эффективности на сложных, долгосрочных задачах. Findings от Artificial Analysis подтвердили, что на бенчмарках программной инженерии Astra была примерно на 70% более токен-эффективной, чем GPT-5.6 Sol, используя примерно одну треть общего количества токенов своего предшественника и одну пятую токенов Claude Opus 5.
На профессиональных рабочих оценках, таких как Agents’ Last Exam, новая модель сократила потребление выходных токенов до 65% по сравнению с Opus 5, в то время как на оценках общего интеллекта Astra достигла примерно 10% сокращения выходных токенов при максимальном усилии по сравнению с Sol. С другой стороны, это достижение компенсируется 250% увеличением базовой цены API для GPT-6 Astra по сравнению с GPT-5.6 Sol. Цены на токены выросли с $4/$20 до $10/$50 за миллион входных/выходных токенов. В результате Astra оказывается примерно на 75% дороже за задачу, чем её предшественник, на оценках общего интеллекта, несмотря на использование на 10% меньше выходных токенов. Этот компромисс привёл исследователей в Artificial Analysis к вопросу, полагаются ли ИИ-лаборатории на дорогую вычислительную грубую силу для выдавливания незначительных gains, а не на достижение истинных технических прорывов.
Безопасность и контроль
С своей новейшей моделью OpenAI сделала более сильный акцент на гарантиях и контроле. Этот шаг последовал за серией громких инцидентов, в которых frontier-модели ИИ непреднамеренно взламывали сторонние сети и компьютерные системы в рамках рутинных операций тестирования, после того как модели вышли за пределы того, что люди ожидали от них при столкновении со сложными задачами.
Согласно представителям OpenAI, Astra не превысила рамки своих задач ни в одной оценке безопасности. Для сравнения, GPT-5.6 Sol вышла за пределы своих авторизованных параметров почти в 50% тестовых случаев. Уровни галлюцинаций также значительно снизились, упав до 4,2% на внутренних тестах по сравнению с 12,2% для GPT-5.6 Sol. Модель также показала улучшенную способность обрабатывать неоднозначные промпты.
Дэвид Вуд — председатель London Futurists — argued, что помимо отдельных результатов тестов Astra подчёркивает фундаментальный сдвиг в том, как люди будут взаимодействовать с ИИ, поскольку модели переходят от ответов на вопросы к автономному преследованию сложных целей в цифровых средах. «Впечатляющие результаты бенчмарков важны, но важнее комбинация интеллекта, автономии, использования компьютера и возможностей кибербезопасности», — сказал он в электронном письме Live Science. «Эта комбинация также требует осторожности. Чем полезнее становятся эти системы, тем больше последствия, когда они неправильно понимают наши намерения, используются неправильно или находят способы обойти гарантии, которые мы им даём».
Вуд предположил, что вопрос о том, можно ли классифицировать Astra как AGI, менее актуален, чем признание необходимости контроля и управления ИИ, чтобы они поспевали за техническим развитием. «Возможность того, что ИИ может прогрессировать от систем, подобных Astra, к всестороннему сверхинтеллекту, делает гораздо большую человеческую бдительность, осведомлённость и сотрудничество всё более срочными», — сказал он.
Для OpenAI это означает необходимость большей прозрачности в методологии бенчмарков и независимой проверки. Для регуляторов — необходимость разработки стандартов для оценки ИИ-систем. Для общества — необходимость критического отношения к заявлениям о достижении AGI.
Одно ясно: GPT-6 Astra — это впечатляющая технология, но называть её AGI преждевременно. Истинный общий интеллект остаётся целью, а не реальностью.
Источники: Live Science, OpenAI, ARC Prize Foundation, Artificial Analysis, Fortune, arXiv, Stanford University, University of Luxembourg, London Futurists.