Карточный домик нейронаук: почему тысячи исследований мозга не проходят проверку временем

Карточный домик нейронаук: почему тысячи исследований мозга не проходят проверку временем

 

Одно из центральных допущений современной нейронауки гласит, что форма и структура мозга влияют на поведение. Ученые связывали более толстую кору (внешний слой мозга) с высоким интеллектом, определенные паттерны мозговых волн — с выдающимися способностями в волейболе, а повышенную связность между участками мозга — с мастерством в шахматах. Подобных так называемых полногеномных ассоциативных исследований мозга (BWAS) накопилось огромное множество. Но когда эксперты пытаются их повторить, результаты не воспроизводятся.

Этот «кризис воспроизводимости» указывает на то, что значительная часть исследований, связывающих визуализацию мозга с поведением, покоится на шатком фундаменте. Проблем, поразивших эту область, великое множество, говорит Рэнди Эллис, старший научный сотрудник Oracle, который писал об этих вопросах, еще работая биомедицинским информатиком в Школе медицины Икана при медицинском центре Маунт-Синай в Нью-Йорке. Часть этих проблем не уникальна для нейронаук. Они начинаются с того, что Эллис называет «первородным грехом» науки: на академических ученых оказывается колоссальное давление с требованием публиковать положительные результаты. Но некоторые факторы специфичны именно для этой области. Проблемы настолько серьезны, что они «тормозят рост и развитие науки и излечение болезней», заявил Эллис Live Science.

Крошечные выборки и статистические миражи

Несколько исследований мозга, которые не удалось воспроизвести в последующих работах, наглядно демонстрируют, как подкрадываются проблемы. Каждая из оригинальных статей имеет более 500 цитирований, и количество ссылок отражает, насколько сильно эти работы могли повлиять на мышление в данной области.

Например, этапное исследование 2007 года обнаружило, что мозгу детей с синдромом дефицита внимания и гиперактивности требуется больше времени для созревания. Но работа, опубликованная ранее в этом году, показала, что эта связь исчезает, если принять во внимание разницу в темпах старения между мальчиками и девочками. «Именно это заставило рассыпаться весь карточный домик», — заявил Live Science Мэттью Олбо, соавтор проверочной работы и клинический нейробиолог из Университета Вермонта.

В 2011 году исследователи из Университетского колледжа Лондона опубликовали работу, согласно которой плотность серого вещества — участков мозга, где находятся тела нейронов, — в нескольких зонах была связана с количеством друзей участников в Facebook (в 2011 году это считалось важнейшей социальной метрикой). Статья 2015 года не смогла воспроизвести этот результат, но авторы оригинала утверждали, что причина в несоблюдении протокола. «Трудно в точности повторить то, что делалось в оригинальных исследованиях», — пояснила Сара Женон, нейробиолог из Исследовательского центра Юлих в Германии, не участвовавшая ни в «фейсбучном» исследовании, ни в его проверке.

Поэтому в 2019 году Женон с коллегами испробовали иной тип проверочного анализа. Они воспользовались обширной базой данных и провели более 10 000 анализов МРТ-снимков сотен добровольцев. Медианный размер выборки в нейровизуализационных исследованиях составлял около 25 человек, так что они разбили этот крупный массив на множество мелких и принялись искать значимые ассоциации внутри каждого. Если одно из таких микроисследований сообщало о значимой связи между поведением и структурой мозга, команда пыталась получить те же результаты на другом подмножестве данных. Лишь очень немногие из повторных исследований воспроизвели итоги первого. «Это было явным доказательством того, что воспроизводимость этих ассоциаций «мозг-поведение» относительно слаба», — сказала Женон.

Одна из ключевых проблем в том, что у здоровых добровольцев вариации между индивидуальными особенностями мозга относительно невелики, а значит, для обнаружения средних различий, привязанных к поведению, требуется большое число участников, пояснила Женон. Это напоминает полногеномные ассоциативные исследования, которые улавливают мельчайшие эффекты отдельных генов, требующие выборок в десятки и сотни тысяч человек для выявления устойчивых закономерностей. Чтобы обнаружить осмысленные различия в полномозговых визуализационных исследованиях, как показала статья 2022 года, необходимы выборки в тысячи человек. Поскольку получение МРТ-снимков дорого и трудоемко, большинство работ опиралось на куда более скромные выборки.

Статистическая подгонка и иллюзия биотипов

Кроме того, поведенческие тесты, используемые для установления психологических переменных, могут быть непоследовательными, отметила Женон. Более того, некоторые исследования, возможно, исходят из устаревшего предположения, что крошечные участки мозга управляют такими сложными характеристиками, как интеллект. В реальности же «подобные способности обычно относительно распределены по мозгу», сказала она. Когда исследователи, руководствуясь этим предположением, анализируют множество мелких мозговых зон с помощью отдельных статистических тестов, это может повысить риск возникновения фантомных ассоциаций.

Некоторые работы ущербны с самого начала. В 2017 году ученые из Медицинского колледжа Вейл Корнелл с помощью МРТ-данных попытались стратифицировать пациентов с депрессией. Они пришли к выводу, что мозговая активность образует четыре «биотипа» депрессии, каждый из которых отличается аномальными паттернами активности в ключевых нейросетях. Однако последующее исследование показало, что различия между кластерами не были статистически значимыми, то есть могли возникнуть случайно. Ричард Динга, нейробиолог из Йенского университета имени Фридриха Шиллера в Германии, участвовавший в проверке, указал, что главные проблемы крылись в дизайне. По его словам, статистический подход практически гарантировал обнаружение значимых связей из-за переобучения: модель так точно подгонялась под один набор данных, что с трудом находила реальные закономерности в других. Этот дизайн коррелировал 17 клинических признаков депрессии с 30 000 признаков визуализации мозга, но, как заметил Динга, авторы могли бы взять «30 000 подбрасываний монетки» и получить ту же сильную корреляцию.

Соавтор оригинальной статьи, психиатр Вейл Корнелл Медисин Конор Листон, признал подверженность модели переобучению. «Это вовсе не входило в наши намерения, но таков был результат», — сказал он Live Science. Тем не менее он настаивает, что обнаруженные биотипы реальны, ссылаясь на более поздние работы своей команды. На вопрос, почему его группа не обновила оригинальную статью, признав наличие серьезных изъянов в методе анализа, Листон ответил, что их последующих публикаций достаточно для корректировки картины. «Думаю, месседж уже озвучен, и решения проблемы переобучения совершенно ясны», — заявил он.

Спасение в больших данных и открытости

Результаты множества работ с теми же проблемами, что у перечисленных статей, никогда не будут перепроверены и останутся в научном багаже. Прежде всего, на воспроизведение никто не выделяет денег. «Грантовые агентства не придут в восторг» от идеи финансировать исследование, цель которого — подтвердить прошлые результаты, говорит Женон. А если такие работы и выполняются, их реже публикуют, особенно когда они подрывают прежние выводы.

Для Динги путь вперед — сбор большего количества данных. «Именно это решило ту же проблему невоспроизводимости в генетике», — говорит он, имея в виду полногеномные ассоциативные исследования, добившиеся важных открытий за последние два десятилетия с помощью выборок, достигших миллионов. Но не менее важно улучшать дизайн исследований, добавляет он, ведь более масштабные наборы данных не исправят работы с некорректными подходами к анализу. «У этих методов просто нет шанса дать что-то полезное», — подчеркивает он.

Некоторые исследователи уже используют крупные базы данных нейровизуализации. Мартин Хебарт, руководитель группы в Институте когнитивных и нейронаук человека Общества Макса Планка в Германии, и Лука Кеммер, докторант в его лаборатории, развивают проект re:vision — самую масштабную на сегодня инициативу по сбору визуализационных данных о том, как мозг реагирует на зрительные стимулы. Они планируют предоставить эту информацию другим ученым, которые затем проверят, воспроизводятся ли гипотезы из других работ на наборе данных re:vision. Хебарт и Кеммер говорят, что уже получили более дюжины заявок на участие. Особенно позитивно восприняли проект молодые исследователи. А вот убедить старших коллег перепроверить свои данные может оказаться сложнее — ведь им есть что терять, если давний результат в итоге не подтвердится, заметил Кеммер. «Все всегда говорят, что воспроизводимость — это здорово, — сказал он Live Science. — Но когда я предлагаю проверить их конкретные работы, часто они настроены чуть более скептически».

Источники: Live Science, Nature, Science, Journal of Neuroscience.

Добавить комментарий