Мир в голове робота: что такое «мировые модели» и почему они вот-вот вырвут ИИ из чатов в реальность

Мир в голове робота: что такое «мировые модели» и почему они вот-вот вырвут ИИ из чатов в реальность

 

Всего за несколько лет искусственный интеллект преобразил то, как мы взаимодействуем с компьютерами, и угрожает перевернуть обширные сектора рынка труда. Однако большие языковые модели (LLM) по-прежнему спотыкаются о беспорядочную реальность физического мира. Исследователи делают ставку на то, что новый тип ИИ — «мировые модели» — сможет это исправить.

На фундаментальном уровне мировые модели делают именно то, что следует из их названия: строят математическую модель мира, которую затем можно использовать для прогнозирования того, как он изменится в ответ на определенные действия или меняющиеся условия. «Мир» в данном контексте не обязательно означает всю физическую реальность. Скорее, речь идет о среде, в которой модель работает, — от склада до видеоигры.

Что именно считать мировой моделью и как лучше всего ее строить, остается предметом немалых споров среди исследователей ИИ. Но мировые модели стали бы значительным шагом вперед по сравнению с LLM, которые, несмотря на их впечатляющие способности, просто предсказывают наиболее вероятное следующее слово в последовательности.

Надежда заключается в том, что, развив более глубокое понимание сложных сред, мировые модели смогут позволить ИИ наконец вырваться из чат-интерфейса, открывая потенциально революционные применения в робототехнике, автономном вождении и научных открытиях.

«Эта идея тесно связана с интуитивными моделями в нашем человеческом сознании, — говорит Юнчжу Ли, доцент кафедры компьютерных наук Колумбийского университета. — Мы можем представить, как изменится окружающая среда, как двинется объект, когда вы примените конкретное действие. И мы, по сути, хотим построить такого же рода модель для любых роботов или любых виртуальных агентов, чтобы они могли вообразить последствия своих действий».

Строим мировые модели в уме

Хотя «мировые модели» — новейшее модное словечко Кремниевой долины, у этой концепции глубокие корни. Впервые она привлекла внимание в 1950-х годах, когда когнитивные ученые попытались описать ментальные модели, которые люди использовали для симуляции окружающей среды в своем сознании, рассказала Live Science Маньлин Ли, доцент кафедры компьютерных наук Северо-Западного университета. Концепция также глубоко связана с теорией управления и часто вдохновлена ею — это раздел прикладной математики, используемый для создания моделей физических систем, чтобы ими можно было предсказуемо управлять. На этом держится всё — от термостатов до систем автопилота в самолетах.

Однако сегодня термин «мировые модели» относится прежде всего к нейросетям, которые обучаются модели окружающей среды, тренируясь на данных. Современное воплощение идеи восходит к исследованию 2018 года под названием «World Models» ученого Дэвида Ха и пионера глубокого обучения Юргена Шмидхубера. Ранние модели от Google, такие как PlaNet и Dreamer, были одними из первых, кто решал задачи, сначала делая предсказания об исходе различных действий.

Хотя идея мировой модели довольно интуитивна, более точное определение — это любая система, способная к «предсказанию будущего, обусловленному действием», пояснил Юнчжу Ли. По сути, это означает, что модель может предсказать, как конкретное действие изменит состояние мира вокруг нее. По словам Маньлин Ли, такое предсказание состоит из двух ключевых задач: оценка состояния и переход состояния. Оценка состояния — это способность воспринимать текущее состояние среды и кодировать его в формат, пригодный для вычислений, а переход состояния означает способность предсказывать, как конкретное действие заставит среду эволюционировать.

Данные, питающие новые реальности

Мировые модели на основе глубокого обучения учатся обеим задачам, тренируясь на огромных массивах данных. Но какие именно данные, как их следует кодировать и обрабатывать — это проектные решения, и разные группы применяют различные подходы, отметил Юнчжу Ли. Мировые модели обучаются преимущественно на видеоданных, хотя могут также учиться на 3D-данных, полученных с помощью лидара или других датчиков глубины, аудиоданных и даже текста, объясняющего взаимосвязи между элементами среды. Ключевой момент: всё это должно быть сопряжено с данными о действиях — углами суставов робота, показаниями движения с инерциального датчика или текстовыми метками событий, описывающими, какое действие было предпринято.

Обычно эти данные организованы в последовательности пар «состояние-действие» — по сути, записи того, как выглядел мир и какое действие было применено на каждом шаге. Затем ИИ использует эти данные для изучения статистической модели того, какое влияние различные действия оказывают на окружающую среду, что можно применять для предсказаний. Эти данные можно обрабатывать по-разному: один из самых популярных подходов — работать напрямую с сырыми пикселями, представляя состояние мира как серию изображений и предсказывая, как действия их изменят. Другой подход — использовать данные для изучения трехмерных геометрических представлений мира, которые более явно кодируют пространственные и физические отношения между объектами в сцене.

Сила математических абстракций

В последнее время, однако, растет интерес к подходам, работающим на более абстрактном уровне. Когда нейросеть обучается на данных изображений, она создает многомерные числовые представления реальных элементов, составляющих визуальную сцену, — так называемые эмбеддинги, — которые существуют в математическом пространстве, известном как «латентное пространство» модели. В пиксельной модели эти абстрактные представления реконструируются в пиксели для предсказаний. Но возможно также проводить симуляции внутри латентного пространства, напрямую предсказывая эмбеддинг следующего состояния среды. Этот подход популяризировал ученый-компьютерщик Ян Лекун, бывший глава AI в Meta и один из «крестных отцов глубокого обучения», со своей Joint-Embedding Predictive Architecture. Он привлек более $1 миллиарда в стартап AMI Labs, который планирует использовать этот подход для построения мировых моделей.

Ключевое преимущество такого подхода — эффективность: пиксельные подходы вынуждены восстанавливать всё изображение при каждом предсказании, даже если меняется лишь малая часть кадра. «Как люди, когда мы представляем эволюцию окружающей среды, нам не нужно воображать точное значение каждого пикселя, — говорит Юнчжу Ли. — Именно поэтому есть большой смысл думать о предсказании в латентном пространстве. Так легче гарантировать, что вы учитесь только тому, что релевантно задаче, и игнорируете нерелевантное». Обратная сторона, однако, в том, что гораздо проще понять, что делает ваша модель, если ее предсказания представлены в визуальном формате, а не в виде абстрактных представлений.

Но вопросы о том, как лучше всего представлять данные в мировой модели, вторичны по сравнению с более масштабной проблемой: откуда вообще брать эти данные? Создатели LLM могли просто «выскрести» весь текст из интернета для начальных базовых моделей, однако высококачественное видео с разметкой действий часто приходится кропотливо курировать. Более того, такие данные могут быть очень разреженными: лишь небольшое число пикселей в изображении меняется в ответ на действие. Это ведет к значительным дебатам о лучших архитектурах для мировых моделей. Почти все LLM сегодня основаны на архитектуре трансформер, которая отлично справляется с быстрым поглощением огромных объемов плотных языковых данных, где каждое слово несет значение, но менее пригодна для разреженных видеоданных. В результате люди экспериментируют с самыми разными архитектурами, и область еще не пришла к единому проверенному рецепту.

Эволюция мировых моделей

Одна из областей серьезных споров — считаются ли мировыми моделями видеогенеративные модели, такие как Sora от OpenAI. Представители OpenAI ранее утверждали, что это «мировой симулятор», и предполагали, что подобные модели могут быть многообещающим путем к «симуляторам физического мира общего назначения». Однако Юнчжу Ли возражает: поскольку эти модели обучаются на сырых видеоданных без каких-либо меток действий, их нельзя считать настоящими мировыми моделями. «Она обусловлена лишь неким начальным языковым запросом, а затем предсказывает всё видео целиком, — говорит он. — Поэтому она не может предсказывать контрфактические варианты будущего — например, что бы произошло, если бы вы применили другое действие?»

Но есть вопросы и вокруг того, действительно ли нынешний подход к мировому моделированию способен достичь своих целей. Подавляющее большинство сегодняшних мировых моделей обучается на больших блоках подготовленных данных. В отличие от них, люди и животные строят свои ментальные модели мира через взаимодействие с окружающей средой, которое обеспечивает непрерывную обратную связь, позволяющую уточнять понимание. «Чтобы обучиться наиболее эффективным мировым моделям, весьма вероятно, нам также понадобится, чтобы мировая модель взаимодействовала со средой и училась на этих онлайн-взаимодействиях», — говорит Юнчжу Ли. Однако пока это остается отдаленной целью: нынешние нейросетевые технологии не способны к такому непрерывному обучению, а допуск полуготовой модели к реальному миру вызывает серьезные опасения в плане безопасности.

Тем не менее, даже более скромная мировая модель может оказаться бесценной для целого ряда приложений. Одни из самых очевидных — помощь роботам и беспилотным автомобилям в навигации и планировании задач. Но они также могли бы служить универсальным симулятором для множества применений, в зависимости от данных, на которых они обучены: от более продвинутых физических движков для видеоигр и цифровых двойников пациентов, помогающих в лечении, до новых способов моделирования физических явлений, таких как климат. Принципиально важно, что, вероятнее всего, возникнет широкое разнообразие мировых моделей. Причина в том, что данные о действиях, критически важные для построения мировой модели, фундаментально связаны с конкретным физическим воплощением — будь то рука робота, человек или дрон. В краткосрочной перспективе это означает, что мировые модели будут адаптироваться под конкретные приложения, хотя у многих в этой области более амбициозные долгосрочные планы. «Люди очень усердно работают и надеются, что при достаточных вычислительных мощностях, достаточном количестве данных и достаточно хороших алгоритмах у нас появится одна единая мировая модель, работающая повсеместно для множества разных приложений», — заключил он.


При подготовке статьи использованы материалы Live Science, комментарии Юнчжу Ли (Колумбийский университет) и Маньлин Ли (Северо-Западный университет), а также данные о проектах Google DeepMind, Meta и OpenAI.

Добавить комментарий