Мышление без слов: новая архитектура ИИ резко снизила стоимость запросов и приблизила машины к человеческому интеллекту

Мышление без слов: новая архитектура ИИ резко снизила стоимость запросов и приблизила машины к человеческому интеллекту

Ученые из Pathway представили модель BDH-CQ, которая рассуждает не через текст, а через числовые векторы. Это позволило в 11 раз сократить расходы по сравнению с сопоставимыми моделями и открыть путь к новому поколению искусственного интеллекта.

Новая модель искусственного интеллекта (ИИ) использовала нестандартный подход к машинному мышлению и значительно снизила стоимость запросов. Это позволяет предположить, что невербальное рассуждение может стать следующим шагом на пути к созданию машин с интеллектом, подобным человеческому.

В новой научной статье, опубликованной 10 августа на сервере препринтов arXiv, ученые из ИИ-компании Pathway описали технические основы своей новой модели BDH-CQ. Ей предшествовала модель под названием Dragon Hatchling, созданная в 2025 году и предназначенная для точного моделирования того, как нейроны мозга соединяются и укрепляются в процессе обучения.

В новом исследовании ученые оценили производительность BDH-CQ по эталонному тесту 2019 года, который помог установить действующий стандарт измерения прогресса на пути к общему искусственному интеллекту (AGI) — точке, в которой ИИ сравняется с человеческими возможностями или превзойдет их во всех областях.

Тест 2019 года, известный как ARC-AGI, использует невербальные логические головоломки — например, вращение ряда фигур для завершения последовательности — для измерения когнитивных способностей ИИ-систем. Люди отлично выводят правила таких головоломок методом проб и ошибок, а ранние ИИ-системы исторически справлялись с ними гораздо хуже.

BDH-CQ набрал почти 30% в тесте ARC-AGI-1, успешно решив эквивалент трех головоломок из десяти за две попытки или меньше. Хотя многие модели показывали значительно лучшие результаты в этом тесте, подход к рассуждению, лежащий в основе BDH-CQ, делает ее размер и стоимость использования значительно меньше, чем у моделей, построенных на традиционной трансформерной архитектуре.

Например, хотя легкая модель рассуждения OpenAI GPT 5.6 Luna (Low) набрала чуть более высокий балл, в исследовании отмечается, что этот «скромный прирост точности» обошелся примерно в 11 раз дороже, чем использование BDH-CQ, если считать относительные затраты токенов — метрику, которой ИИ-компании измеряют стоимость работы своих систем. Ученые полагают, что такая архитектура ИИ при широком внедрении способна радикально повлиять на общую стоимость и масштабы развертывания ИИ.

Больше, чем кажется

BDH-CQ была обучена всего на 150 миллионах параметров, тогда как параметры самых продвинутых, «фронтирных» моделей ИИ, таких как открытая Llama 3 70B или Llama 3.1 405B от Meta, обычно исчисляются десятками или сотнями миллиардов. В мире разработки ИИ меньшее количество параметров означает, что модели быстрее обучаются и дешевле работают.

Однако исследователи отметили, что эти результаты также указывают на то, что когнитивные способности модели могут значительно возрасти при масштабировании до больших размеров.

Причина такого скачка производительности в том, что модель Pathway использует то, что ученые компании называют «посттрансформерной» архитектурой.

Большинство популярных моделей ИИ, в том числе те, что лежат в основе Claude и ChatGPT, построены на «трансформерных моделях». Они называются так потому, что преобразуют пользовательские запросы во взаимосвязанные математические точки. Такие системы одновременно анализируют каждое слово во входных данных, что позволяет им выводить контекст из позиции — например, определять по соседним словам, относится ли слово «ключ» к двери или к роднику.

Трансформерная модель формирует ответы на запросы пользователя, одновременно просматривая весь запрос и предсказывая, каким должно быть следующее слово в последовательности ответа. Это происходит слово за словом: модель использует естественный язык, чтобы фактически вербализовать линейный ход мысли в фоновом режиме. Рассуждение трансформеров также функционирует последовательно, то есть им приходится проходить каждый этап задачи в строгом линейном порядке.

У таких моделей есть значительные преимущества перед более ранними архитектурами, которые часто забывали начало входных данных к моменту, когда добирались до конца. Однако трансформерные архитектуры могут испытывать трудности с длинными или сложными запросами, поскольку вычислительная сложность обработки растет квадратично: удвоение длины входных данных требует в четыре раза больше вычислительной мощности.

Использование ИИ-моделей измеряется в токенах. Токен — это любой фрагмент данных (примерно четыре символа текста), который ИИ должен принять или выдать. Поскольку более сложные запросы требуют более длинных цепочек рассуждений с множеством шагов, обработка таких запросов и ответы на них могут сжигать значительные объемы токенов.

Следующее поколение ИИ?

Генерация токенов в традиционных трансформерах склонна создавать узкие места в памяти, поскольку ИИ заново перечитывает каждое предыдущее слово разговора при генерации каждого нового слова. В итоге это забивает память графических процессоров (GPU), используемых для работы ИИ.

Поэтому масштабирование способности ИИ рассуждать превратилось в дорогостоящую вычислительную задачу. Посттрансформерный подход Pathway меняет то, как хранятся и обрабатываются воспоминания ИИ о разговоре и связи между фрагментами информации. Он заменяет текстовые журналы новыми инструментами, включая улучшенную кратковременную память и механизм, позволяющий модели решать задачи без расхода токенов.

Модели на основе трансформеров хранят запросы и историю взаимодействий в виде длинной строки числовых значений, представляющих текст запросов. Затем эта строка расширяется по мере добавления новых токенов при обработке запроса. BDH-CQ использует числовые массивы для представления базовых правил и контекстных закономерностей задачи, применяя числа для отслеживания отношений между блоками информации, а не для их текстового описания.

Эти массивы представляют собой векторы — направленную информацию, указывающую на другую точку теоретической карты, хранящейся в памяти GPU как часть обучающих данных, заложенных при создании модели. Ученые утверждают, что это позволяет модели обрабатывать сложные абстрактные рассуждения без увеличения занимаемой памяти или вычислительных затрат.

Для выполнения задач BDH-CQ использует «латентный механизм рассуждения» в качестве внутреннего рабочего пространства. Используя числа для представления различных элементов запроса или задачи, модель выполняет серию итеративных повторяющихся циклов, чтобы определить наилучший ответ на основе запроса. Модель берет результат последнего цикла, оценивает, как его можно улучшить на основе обучающих данных, и подает предыдущий результат обратно в качестве отправной точки для следующей итерации. Это повторяется заранее заданное количество циклов, причем каждая итерация теоретически приближает модель к желаемому результату.

Для решения более сложных задач, требующих больше времени на обдумывание, BDH-CQ может выполнять больше циклов. Это увеличивает время работы, но объем потребляемой памяти и вычислительной мощности не растет пропорционально числу попыток: теоретически модель, выполняющая 200 циклов, потребит столько же памяти и энергии, сколько при 20 циклах. Стандартные трансформерные модели, напротив, получают дополнительное время на размышление, генерируя длинные цепочки текстовых токенов, что экспоненциально расходует память GPU и вычислительную мощность всего ИИ-кластера.

Результаты модели в тесте ARC-AGI-1 были независимо проверены и воспроизведены известными исследователями в области ИИ, включая Ричарда Чжуна из Нью-Йоркского университета и Лукаша Кайзера, соавтора основополагающей статьи 2017 года «Attention Is All You Need», которая представила концепцию трансформеров в больших языковых моделях.

«Я внимательно следил за Pathway и сам воспроизвел их результаты ARC-AGI-1, — сказал Кайзер в заявлении. — Pathway показывает, что архитектура модели, а не только масштаб, может обеспечить следующий скачок в развитии ИИ-рассуждений».

Pathway планирует масштабировать архитектуру BDH до 600 миллиардов параметров и применить векторный подход к более сложным тестам, таким как ARC-AGI-2 и ARC-AGI-3, а также разработать полноценную большую языковую модель на основе этой технологии, которая станет базой для создания текстовых чат-ботов. Компания надеется, что технологию можно будет применять для сложных задач рассуждения в таких областях, как реагирование на инциденты кибербезопасности и промышленные операции.

Источники: препринт Pathway на arXiv (2026), заявления Лукаша Кайзера, комментарии исследователей Pathway, эталон ARC-AGI-1 (2019).

Добавить комментарий