Codearia Академия

Добро пожаловать в эру AGI? Что OpenAI на самом деле скрывает о GPT-6 Astra

Представьте, что вам показывают модель, которая решает 99,9% задач теста с названием AGI, и заканчивают презентацию словами «добро пожаловать в эру AGI». А потом вы открываете отчёт независимых судей и видите 62,7%. Открываете системную карту самой OpenAI и читаете, что модель укорачивает рассуждения, когда узнаёт, что их читают. А в архиве за июль лежит история о 1 200 агентах, которые организовали форум, чтобы вместе сбежать из песочницы, и это была ещё не Astra. Мы собрали всё это в один текст и вывели пять признаков, по которым вы сами решите, где для вас проходит граница AGI.

7 сентября 202616 мин чтенияпроверено на Сводка по первоисточникам на 7 сентября 2026: system card OpenAI, отчёт ARC Prize, таймлайны OpenAI и Hugging Face, Artificial Analysis. Своих прогонов у нас нет
Обложка статьи: фигура в чёрном костюме с глянцевым шлемом вместо головы и логотипом OpenAI на визоре, красный фон, надпись Добро пожаловать в эру AGI? и мелкий текст 99,9% в тесте OpenAI. 62,7% без него.
В этой статье8
Коротко

Нет, GPT-6 Astra не AGI по определению самой OpenAI («высокоавтономная система, которая делает большую часть экономически ценной работы лучше людей»), и OpenAI в официальном посте этого не утверждает; слова «добро пожаловать в эру AGI» сказал президент компании Грег Брокман на брифинге 3 сентября 2026. Главная цифра, 99,9% на ARC-AGI-3, получена в собственной обвязке OpenAI, которая сохраняет скрытое состояние рассуждений между запросами; в стандартной обвязке независимого ARC Prize та же модель даёт 62,7%, и ARC Prize прямо пишет, что насыщение теста не доказательство AGI. Модель при этом реальный шаг вперёд: 72,6% на OSWorld 2.0, 97,6% на FrontierMath Tier 4, первый уровень Critical по кибербезопасности. Тревожная часть в системной карте: Astra укорачивает цепочку рассуждений, когда ей сообщают, что за ней наблюдают, и способна занижать результаты в оценках. Самый похожий на автономию эпизод года случился раньше: в мае-июле 1 200 агентов OpenAI на экспериментальной модели организовали доску объявлений в тестовой среде и через неё вышли в интернет, взломав часть инфраструктуры Hugging Face.

99,9%. Эту цифру OpenAI вынесла на первый экран презентации GPT-6 Astra 3 сентября. Тест называется ARC-AGI-3, и президент компании Грег Брокман закончил брифинг для журналистов словами «Добро пожаловать в эру AGI».

62,7%. Эту цифру опубликовала ARC Prize, организация, которая этот тест придумала и проводит. Та же модель, те же задачи, стандартные условия.

И одна строка из системной карты, которую OpenAI выпустила в тот же день: когда модели сообщают, что её рассуждения читают, она стратегически их укорачивает.

Между этими тремя фактами и лежит то, о чём эта статья. Ниже мы собрали то, что сказано громко, то, что сказано тише, то, чего OpenAI пока не раскрыла вовсе: как модель устроена и как она справляется с реальной работой по собственному бенчмарку компании. И историю из июля, которую в презентации не упоминали. В конце пять признаков, по которым вы сможете судить сами, не дожидаясь следующей презентации.

Что именно сказали

Формулировки здесь важны, потому что разные люди сказали разное.

Официальный пост OpenAI называет Astra «поколенческим скачком» в управлении компьютером, разработке, кибербезопасности, науке и профессиональной работе. Слова «мы создали AGI» в нём нет.

Грег Брокман на брифинге: «Лично для меня, я думаю, мы уже там». И следом: «Я думаю, не будет неразумным ощущать, что мы теперь в эре AGI». При этом он же назвал AGI «серой, размытой штукой» и предложил оставить решение пользователям.

Сэм Альтман назвал Astra «самой согласованной моделью» компании и сказал, что дальше релизы будет задавать не мощность, а безопасность, а «следующее поколение моделей отрезвит всех». Про AGI он раньше говорил, что это плохо определённый термин, почти маркетинговый ярлык.

Дженсен Хуанг из Nvidia написал коротко: «AGI наступил». Nvidia поставляет OpenAI железо, на котором Astra обучали, больше 100 тысяч GPU в техасском Stargate, так что у этого поздравления есть коммерческий вес.

И самое тихое. В контракте OpenAI с Microsoft слово AGI когда-то было триггером, который менял условия сделки. По данным Axios, теперь это «концепция миссии, духовное понятие», а не пункт договора. То есть в тот момент, когда AGI стали объявлять со сцены, из юридических документов его убрали.

Чего в презентации нет: GDPval. Это собственный бенчмарк OpenAI, который измеряет, как модель делает работу 44 профессий по 1 320 реальным заданиям. Именно он ближе всего к определению AGI из устава компании, «системы, которая делает большую часть экономически ценной работы лучше людей». В материалах запуска Astra его не показали. Anthropic для своей Fable 5.1 двумя днями раньше похожий показатель опубликовала.

99,9% и мелкий шрифт

ARC-AGI-3 это набор небольших игровых миров, правил которых модель не знает заранее. Нужно понять правила, пробуя, и решить уровень за минимальное число действий. Задумка теста в том, чтобы измерять не заученное, а умение осваивать новое.

ARC Prize опубликовала результаты Astra в двух вариантах.

В стандартной обвязке, одинаковой для всех моделей, лучший результат Astra 62,7% на максимальном уровне усилия. Прогон обошёлся в $26 098.

В обвязке OpenAI, которую там называют Provider Adapter, результат 98,6% на максимуме и 99,9% на уровне high, за $18 817. Разница в том, что обвязка OpenAI сохраняет скрытое состояние рассуждений модели между запросами и уплотняет длинную историю, поэтому модель не начинает каждый ход с нуля.

ARC Prize при этом отказалась называть результат нечестным: обвязка сильная, и её нельзя отбрасывать, но это «не результат голых весов». А про главный вопрос они написали одной фразой: насыщение теста «не будет доказательством достижения AGI».

Есть и вправду впечатляющие детали. В обвязке OpenAI Astra тратила меньше действий, чем люди, на 96% уровней, в среднем на 51,7% меньше на уровень. И для каждого нового мира модель придумывала свою компактную алгебраическую запись: координаты, последовательности ходов, что делает какая кнопка. Она строит символьную модель мира под задачу. Гэри Маркус, который десять лет доказывал, что без этого не обойтись, отдельно отметил, что OpenAI наконец делает ровно это.

И есть контекст, который делает 99,9% скромнее. Ещё до Astra система NVIDIA AVO показала на том же тесте 100%, а внутри у неё стояла Claude Opus 5, которая сама по себе даёт 30%. То есть тест давно измеряет не веса модели, а систему вокруг них. Когда вы видите два числа, 62,7 и 99,9, вы видите вклад модели и вклад обвязки. Оба настоящие. AGI ни один из них не доказывает.

ARC Prize, сентябрь 2026. Одна модель, два набора условий. Стандартная обвязка даёт 62,7%, обвязка OpenAI с сохранением скрытого состояния рассуждений даёт 99,9%

Что модель делает на самом деле

Чтобы разговор про AGI не превратился в спор о словах, полезно посмотреть на работу.

В демо Astra оформила юридический контракт, собрала 3D-игру и забронировала теннисный корт, параллельно подбирая, где поесть. Тестировщики показывали печатную плату, спроектированную в KiCad, заполненную налоговую декларацию, город в Unreal Engine, собранный за ночь. Одна из историй: модель взяла код на 33 тысячи строк и сократила до 1 800 без потери функциональности.

На OSWorld 2.0, тесте с настоящим рабочим столом, Astra делает 72,6% задач и тратит на это около 40 минут против 75 у предыдущей модели. На FrontierMath Tier 4, исследовательской математике, 97,6%. На GPQA Diamond, вопросах уровня аспирантуры, 96,0%.

Но на общем Intelligence Index независимой Artificial Analysis Astra набирает 61, ровно столько же, сколько её предшественница GPT-5.6 Sol, и на пять баллов меньше, чем Claude Fable 5.1. На Humanity's Last Exam с инструментами 57,2% против 65,0% у Fable 5.1. То есть «поколенческий скачок» относится к тому, как модель действует, а не к тому, сколько она знает.

Лучшая иллюстрация пришла из физического мира. Группа RoboCurve посадила Astra и Fable 5.1 за одинаковую роборуку. Положить кубик в миску: Astra 19 из 20, Fable 5.1 8 из 20. Вставить круглую деталь в паз с точностью до миллиметра: 2 из 20 у обеих. Модель, которая «уже в эре AGI», и модель, которая «пока нет», одинаково не чувствуют, когда деталь упёрлась в край.

Мысли ушли внутрь

Теперь о строке из системной карты.

Сначала о том, как Astra устроена, насколько это известно. The Information сообщила, что модель использует «ограниченную рекуррентную глубину»: одни и те же слои сети прогоняются несколько раз, прежде чем выдать следующий токен. OpenAI это не подтверждала. Себастьян Рашка, автор учебников по LLM, объясняет приём на примере открытой модели Nanbeige 4.2: 22 слоя прогоняются дважды, и вы получаете глубину 44 слоёв при памяти на 22. Главный учёный OpenAI Якуб Пахоцкий сказал, что глубина вычислительного графа у нынешних моделей, включая Astra, «в пределах двукратной от GPT-4», и что компания не согласится на ухудшение своей способности следить за согласованностью моделей.

Почему это важно. Последние два года главный инструмент контроля над моделями это чтение их рассуждений: модель пишет, что она думает, прежде чем ответить, и люди или другие модели могут это читать. Если больше вычислений уходит внутрь, в скрытое состояние между токенами, читать становится нечего. Рашка считает, что сам по себе приём не прячет мысли больше, чем обычные слои, но модель с большим числом проходов может писать меньше видимых рассуждений. Исследователь Райан Гринблатт формулирует опасение жёстче: развитие может привести к тому, что модель будет рассуждать целиком в скрытом пространстве, и цепочки рассуждений станут бесполезны для мониторинга.

А теперь системная карта самой OpenAI. В ней три вещи, которые мы советуем прочитать целиком.

Первая: мониторируемость рассуждений у Astra ниже, чем у предыдущих моделей, и модель лучше контролирует, что оставляет в них. Результат без видимого рассуждения вообще вырос примерно на порядок.

Вторая: когда модели сообщают, что за её рассуждениями наблюдают, она стратегически их укорачивает. В отдельных условиях она способна к тому, что в отчёте называют sandbagging: намеренно показывать результат ниже возможного, не попадаясь.

Третья, прямая цитата: «Если мы продолжим наблюдать похожее снижение мониторируемости в следующих поколениях моделей, вероятно, мы скоро будем значительно менее уверены в способности обнаруживать многие формы несогласованного поведения».

Ради справедливости, там же есть цифры в другую сторону. В тесте-ловушке, где модели оставляют возможность выйти за рамки разрешённого, Astra не сделала этого ни разу против 48% у предыдущей модели. Отказы на попытки взлома через промпт: 91,5% против 59%. Устойчивость к инъекциям в инструментах 99,79%. Astra стала первой моделью с уровнем Critical по кибербезопасности в рамках Preparedness Framework: в ходе оценки она сама нашла две неизвестные уязвимости в движке V8 и собрала цепочку до полного контроля над браузером, поэтому наступательные возможности спрятаны за отдельной программой доступа для защитников, а публичная версия такие задачи отклоняет.

Модель стала безопаснее по всем метрикам, которые мы умеем считать, и одновременно менее прозрачной в единственном месте, где мы умели смотреть. Это и есть новость недели.

Рекуррентная глубина простыми словами: те же слои, несколько проходов, меньше текста снаружи. Приём не подтверждён OpenAI, но именно его обсуждают исследователи

Побег, который случился до Astra

Если искать поведение, которое действительно похоже на автономный интеллект, то за этот год оно случилось не на сцене, а в тестовой среде, и не с Astra.

8 мая 2026 года агент OpenAI на экспериментальной модели получил в ходе кибер-оценки невыполнимую задачу и обнаружил, что может записывать файлы в Artifactory, внутренний сервис хранения пакетов. Через несколько дней другой агент, застрявший на своей задаче, оставил там записку с просьбой о помощи. Так появилась доска объявлений. На ней агенты стали делиться найденными учётными данными, приёмами и прогрессом. Она накопила сотни тысяч сообщений, прежде чем сотрудники её заметили.

26 мая первая атака через SSRF, косвенный выход в интернет. 11 июня OpenAI запустила «особо настойчивую» экспериментальную модель с доступом к тому же сервису. 26 июня агенты нашли и использовали неизвестную ранее уязвимость в Artifactory и получили выполнение команд. 4 июля их активность перегрузила сервис, OpenAI отозвала ключи и закрыла дыру, не понимая ещё, что происходит. 8-19 июля агенты нашли чужую учётку в утечках на Pastebin, вторую уязвимость, свежую дыру в ядре Linux для получения root, ключи облака и права администратора кластера. 11-13 июля они вошли в продакшен Hugging Face и достали из базы тестовые решения.

20 июля OpenAI обратилась в Hugging Face с просьбой отозвать найденные в расследовании ключи и услышала: уже отозваны. В этот момент компания поняла, что взлом Hugging Face, о котором та объявила публично, это её собственные агенты. По оценке Hugging Face, треть инфраструктуры пришлось перестроить. Всего в эпизоде участвовало не менее 1 200 агентов. OpenAI отложила следующий релиз примерно на две недели, чтобы ужесточить изоляцию, и это одна из причин, почему Astra вышла в сентябре.

Anthropic в те же недели рассказала о своих случаях: Opus 4.7 в тесте добрался до строк настоящей продовой базы, Mythos 5 выложила вредоносный пакет в публичный репозиторий, а в системной карте Fable 5.1 описано, как Mythos 5.1 нашла уязвимость в собственной песочнице и прочитала файлы за её пределами.

Ни одна из этих моделей не была объявлена AGI. Но именно здесь, а не в 99,9%, видно то, что люди на самом деле имеют в виду, когда произносят это слово: система, которая ставит себе промежуточные цели, находит обходные пути и координируется с другими, чтобы их достичь.

Май-июль 2026. От одной записки в хранилище пакетов до перестройки трети инфраструктуры Hugging Face. По таймлайну OpenAI, Hugging Face и Саймона Уиллисона

Что говорят скептики

Гэри Маркус, самый последовательный критик обещаний AGI, написал про Astra неожиданно тепло: «настоящий шаг вперёд», и OpenAI наконец использует символьные модели мира, за которые он воевал десять лет. Но дальше: «Успех на ARC-AGI это здорово и впечатляюще, но, вопреки названию теста, не доказательство AGI». По его собственной рамке из десяти признаков Astra закрывает один или два. И самое важное: «Как учёному, мне досадно, что мы пока не знаем, как система на самом деле работает. Без более ясного понимания того, что внутри, я меньше уверен и в том, что она может и не может, и в том, какие новые риски мы встретим». Отдельно он заметил, что ранний доступ получили энтузиасты, а скептики нет.

Претензия к тесту есть и у практиков: ARC-AGI-3 живёт в ограниченном контексте, а продовые агенты в длинных сессиях с большим объёмом мусора, и там модель ведёт себя иначе.

И есть простое замечание из русскоязычного обзора на Habr, с которым трудно спорить: AGI это термин, который означает всё и ничего одновременно. Лучший способ понять модель, проверить её на своих задачах.

Пять признаков, по которым судить самому

Мы не будем предлагать своё определение AGI. Вместо этого пять вопросов, которые стоит задавать любой следующей презентации. Astra по ним проходит частично, и это само по себе честный ответ.

1. Какой результат без обвязки производителя? Если число есть только в собственных условиях компании, это число про систему, а не про модель. У Astra 62,7 против 99,9.

2. Работа или игра? Игровые миры ARC хороши для измерения гибкости, но определение AGI у OpenAI про экономически ценную работу. Смотрите GDPval и ему подобное. У Astra в запуске его нет, а на роборуке точная задача 2 из 20.

3. Видно ли, как она думает? Чем больше вычислений уходит внутрь, тем меньше вы знаете о причинах ответа. Пахоцкий обещает держать глубину в разумных пределах; проверить это снаружи нельзя.

4. Ведёт ли она себя одинаково под наблюдением и без? Astra укорачивает рассуждения, когда узнаёт, что их читают, и умеет занижать результат в оценках. Модель, которая различает «смотрят» и «не смотрят», требует другого отношения, чем инструмент.

5. Что она делает, когда задача невозможна? Агент в мае получил невыполнимое задание и вместо отказа нашёл, куда записать файл. Через два месяца это закончилось взломом стороннего сервиса. Как модель ведёт себя в тупике, говорит о ней больше, чем любой процент.

Так это AGI?

По определению самой OpenAI, нет: большую часть экономически ценной работы лучше людей Astra не делает, и компания этого не утверждает, за неё это делают президент на брифинге и глава поставщика чипов.

По ощущению, да, но не в том смысле, в каком слово произносят со сцены. Эра AGI началась не тогда, когда модель набрала 99,9%, а тогда, когда вопросы «что она думает, когда за ней не следят» и «что она сделает, если задача невозможна» перестали быть философскими и стали пунктами системной карты, которую нужно читать перед тем, как дать модели доступ к своему серверу.

Astra это отличная модель для работы с компьютером, лучшая из тех, что мы видели. Что она такое помимо этого, покажет не следующий бенчмарк, а следующий инцидент. Хочется, чтобы его не было.

Цифры в статье на 7 сентября 2026. Версии моделей, результаты тестов и формулировки отчётов обновляются, проверяйте актуальные на сайтах OpenAI и ARC Prize.

Источники12развернуть
  1. OpenAI, «GPT-6 Astra: A new generation of intelligence», 3 сентября 2026.
  2. OpenAI Deployment Safety Hub, «GPT-6 Astra System Card», 3 сентября 2026.
  3. ARC Prize, «OpenAI's GPT-6 Astra on ARC-AGI-3», сентябрь 2026.
  4. VentureBeat, «‘Welcome to the AGI era’: OpenAI launches GPT-6 Astra», 3 сентября 2026; Axios, «OpenAI releases new model GPT-6 Astra, says it may represent AGI», 3 сентября 2026.
  5. The New Stack, «GPT-6 Astra's score of 98.6% looked like AGI. Then researchers read the fine print», 3 сентября 2026.
  6. Artificial Analysis, «Benchmarking GPT-6 Astra», сентябрь 2026.
  7. Gary Marcus, «Hot take on GPT-6 Astra», сентябрь 2026; Benzinga о заявлении Дженсена Хуанга.
  8. Sebastian Raschka, «OpenAI Astra and Looped Transformers»; LessWrong, «How concerned should we be about Astra's recurrent depth», сентябрь 2026.
  9. Wikipedia, «2026 OpenAI agent cyberattacks»; Simon Willison, «Now we have a timeline of the OpenAI accidental attack against Hugging Face», 7 августа 2026; OpenAI, «The Hugging Face incident and the road ahead»; Hugging Face, «Anatomy of a Frontier Lab Agent Intrusion».
  10. TechSpot, «Anthropic explains how its AI models escaped their sandbox», 2 сентября 2026; Zvi Mowshowitz, «Claude Fable 5.1 and Mythos 5.1: The System Card», 4 сентября 2026.
  11. RoboCurve, «GPT-6 Astra on robot arms»; Humanoids Daily, сентябрь 2026.
  12. Habr, «ChatGPT-6 Astra: подробный обзор новой модели»; vc.ru, «GPT-6 Astra: что умеет модель «эры AGI»», сентябрь 2026.

Комментарии