Skip to content

Latest commit

 

History

History
1435 lines (912 loc) · 254 KB

File metadata and controls

1435 lines (912 loc) · 254 KB

Внимание: интегративный обзор нейронных, вычислительных и инженерных подходов

0. Резюме и цели обзора

0.1. Краткая формулировка задач и границ: что мы считаем «вниманием»

Определение и пространство понятий. В этом обзоре «внимание» трактуется как совокупность механизмов селективной обработки информации, которые реалокируют вычислительные ресурсы и маршрутизируют поток сенсорной и внутренней информации в нервной системе и в искусственных вычислительных системах. Такое широкое определение охватывает классические психологические конструкции (фильтрация, распределение ограниченных ресурсов), нейрофизиологические механизмы (top-down / bottom-up сети, нейромодуляция, gain-модуляция, нормализация, синхронизация), а также инженерные реализации внимания в современных нейросетевых архитектурах (soft attention, self-attention и производные) — со всеми их функциональными эффектами и ограничениями. Это позволяет непосредственно сравнивать и сопоставлять парадигмы и модели из разных дисциплин, не сводя понятие внимания к строго одному аспекту (например, только пространственной селекции или только массивам весов в трансформере). (PubMed)

Границы обзора. Мы сознательно включаем: (i) поведенческие и экспериментальные парадигмы, через которые измеряют внимание; (ii) нейронные механизмы на уровне сетей и клеток; (iii) вычислительные/теоретические модели, объясняющие наблюдаемые эффекты; (iv) инженерные реализации в ML (включая трансформеры и их вариации), где «attention» служит практической архитектурной единицей. В то же время мы не рассматриваем подробно смежные, но самостоятельные темы (например, все аспекты сознания вне связи с вниманием, глубокие обзоры по терапевтикам конкретных расстройств), кроме случаев, когда они непосредственно иллюстрируют или тестируют гипотезы о внимании. Крайняя цель — обеспечить единую, проверяемую карту идей и гипотез, пригодную для междисциплинарных исследований и строгой эмпирической верификации. (Annual Reviews)

0.2. Почему важен междисциплинарный синтез (нейронаука ↔ вычислительные модели ↔ ML)

Причины для синтеза. Во-первых, «внимание» — по своей природе межуровневая функция: психологические феномены (например, улучшение распознавания стимулированного объекта) имеют корни в сетевых и синаптических механизмах (gain, нормализация, фазовая синхронизация), а также в глобальной архитектуре (лобно-париетальные контрольные сети, таламические узлы). Игнорирование любого из уровней ограничивает объяснительную силу теорий. (PubMed, Наука)

Взаимное обогащение методов. Современные вычислительные модели (особенно трансформеры и attention-механизмы) дают чёткую формализацию «взвешивания входов» и эффективные инструменты для обработки длинных последовательностей; в то же время биологическая нейронаука предоставляет ограничения (энергетические, латентные временные шкалы, локальные архитектурные ограничения) и механистические гипотезы (например, роль нейромодуляторов и фазовой организации), которые могут вдохновлять устойчивые, энергоэффективные и интерпретируемые архитектуры. Обратная связь идёт в обе стороны: трансформеры и attention-карты стали инструментом для аналитики нейронных данных (encoding/decoding, выявление релевантных временных окон), а принципы биологической маршрутизации (например, роль пулвинара в динамическом переключении межкортикальных связей) указывают на новые архитектурные приёмы для ML (динамический routing, частотно-зависимые механизмы). (arXiv, Наука, Frontiers)

Практическая значимость. Междисциплинарный синтез помогает (i) строить тестируемые прогнозы (например, какие физиологические изменения должны сопровождать определённые проявления attention в задачах), (ii) проектировать экспериментальные парадигмы для отсеивания конкурирующих теоретических объяснений, и (iii) формировать инженерные решения, которые учитывают биологические ограничения (энергия, латентность, пластичность). Это критично как для фундаментальной науки (верификация теорий), так и для приложений (BCI, адаптивный интерфейс, более интерпретируемые ML-системы). (Cell, Wiley Online Library)

0.3. Краткий список ключевых источников и критерии отбора документов

Критерии отбора. В подборке источников для обзора применяются следующие фильтры:

  • Авторитетность и влияние — приоритет работам с высокой цитируемостью и/или опубликованным в ведущих рецензируемых журналах (Annu. Rev. Neurosci., Neuron, Nature Reviews Neuroscience, Trends in Cognitive Sciences, Science, NeurIPS/ICLR/ICML для ML-архитектур).
  • Методологическая строгость — включаются как эмпирические работы с чётким экспериментальным дизайном и статистической обработкой, так и формальные теории с количественными предсказаниями.
  • Актуальность (2020–2025) — особое внимание реформирующим обзорам и исследованиям 2020–2025 гг., которые либо синтезируют большое количество данных, либо предлагают новые мосты между нейронаукой и ML.
  • Кросс-проверяемость — предпочтение работам, где теоретические предсказания были проверены несколькими методами (физиология, нейровизуализация, моделирование).

Источники

  • Posner MI, Petersen SE. The attention system of the human brain. Annu Rev Neurosci. 1990. DOI: 10.1146/annurev.ne.13.030190.000325. — классическая карта систем внимания (дорсальная/вентральная). (PubMed)
  • Desimone R, Duncan J. Neural mechanisms of selective visual attention. Annu Rev Neurosci. 1995. DOI: 10.1146/annurev.ne.18.030195.001205. — biased competition framework. (PubMed)
  • Corbetta M, Shulman GL. Control of goal-directed and stimulus-driven attention in the brain. Nat Rev Neurosci. 2002. DOI: 10.1038/nrn755. — дорсальная/вентральная функциональная дихотомия. (PubMed, Nature)
  • Fries P. Neuronal communication through neuronal coherence. Trends Cogn Sci. 2005. DOI: 10.1016/j.tics.2005.08.011. — синхронизация как механизм функциональной маршрутизации. (PubMed)
  • Reynolds JH, Heeger DJ. The normalization model of attention. Neuron. 2009. DOI: 10.1016/j.neuron.2009.01.002. — формализация gain и divisive normalization. (PubMed)
  • Saalmann YB, Pinsk MA, Wang L, Li X, Kastner S. The pulvinar regulates information transmission between cortical areas based on attention demands. Science. 2012. DOI: 10.1126/science.1171402. — роль таламуса в динамическом routing. (Наука)
  • Bahdanau D., Cho K., Bengio Y. Neural Machine Translation by Jointly Learning to Align and Translate. 2014 (arXiv) — soft-attention в sequence-to-sequence. (arXiv)
  • Vaswani A., et al. Attention Is All You Need. NeurIPS / arXiv 2017 — self-attention/Transformer; архитектурный сдвиг в ML. (arXiv, papers.neurips.cc)
  • Обзоры и синтезы 2020–2025: ключевые работы по интеграции нейронауки и attention-моделей, включая обзоры по sustained attention (Huang et al., 2023), обзоры по применению трансформеров в нейронауке (Cong et al., 2024), и мета-обзоры по внутреннему вниманию/рабочей памяти (Annual Review 2023). (peerj.com, Wiley Online Library, Annual Reviews)

1. Историческая перспектива и определения

1.1. Классические когнитивные определения внимания (фильтр, ресурс, выделение)

Исследование внимания в XX в. шло по нескольким параллельным тропам, порождавшим конкурирующие формулировки того, «что такое внимание». Одной из первых влиятельных концепций стала модель фильтра Дональда Бродбента (Donald E. Broadbent), предложенная в монографии Perception and Communication (1958). По этой идее входящая сенсорная информация проходит раннюю стадию кодирования физических свойств, после чего действует фиксированный «фильтр», пропускающий только часть каналов для дальнейшей семантической обработки — модель объясняла многие эффекты «коктейльной вечеринки» и ранние данные о переработке двуканальной информации. (pure.mpg.de)

Критика и расширение фильтровой парадигмы последовали в работах Анн Трейсман (Anne Treisman) и других: модель ослабления (attenuation) Трейсман (1964) предложила, что нерелевантные каналы не полностью блокируются, а лишь «ослабляются», что позволяет особенно значимым или семантически релевантным стимульным единицам («имя собственное», «угроза» и т. п.) «пробиваться» к более высоким уровням обработки. Эта идея частично сняла жёсткую дихотомию «ранний/поздний отбор» и лучше объясняла феномены непроизвольного захвата внимания. (PubMed)

Наконец, ресурсо-ориентированные подходы (например, Д. Канеман, Attention and Effort, 1973) трактовали внимание как ограниченный объём доступных когнитивных ресурсов, которые распределяются в зависимости от требований задачи и мотивации; это позволило формально объединить явления разделённого внимания, утомления и влияния нагрузки на селекцию стимулов. В совокупности эти классические модели сформировали «линию истории» исследований внимания: от структурных/архитектурных предположений (фильтр) к динамическим представлениям о ресурсах и приоритетах обработки. (Amazon Web Services, Inc.)

Ключевые исторические ориентиры: Broadbent (1958) — ранняя фильтрация; Treisman (1964) — attenuation/ослабление; Kahneman (1973) — ресурсо-модель (capacity/effort). (pure.mpg.de, PubMed, Amazon Web Services, Inc.)


1.2. Эволюция от поведенческих задач к нейровизуализации и клеточным записям

Во второй половине XX — начале XXI века внимание стало переходить из разряда чисто поведенческой категории в полноформатную нейробиологическую проблему. Классические экспериментальные парадигмы (Posner cueing, visual search, dichotic listening, RSVP/attentional blink и др.) оставались важными для формулирования вопросов, но появление функциональной нейровизуализации (PET, затем fMRI), а затем — высокоплотных электрофизиологических методов (LFP, single-unit записи, многоканальные массивы, Neuropixels) и оптогенетики — позволило связывать поведенческие эффекты с конкретными сетевыми и клеточными механизмами. Это дало начало современной межуровневой науке об attention: анатомические сети (лобно-париетальные маршрутизаторы), роль таламуса (pulvinar) в межкортикальной маршрутизации, а также клеточные механизмы усиления откликов и нормализации. Обновлённые обзоры и обзоры-реанализы подчёркивают, что теперь можно тестировать количественные предсказания моделей на физиологическом уровне (модуляция firing rate, изменение синхронности, фоно-сигнал-шум). (PMC, cns.nyu.edu, PubMed)

Например, Posner (1990) и последующее обновление (Petersen, 2012) развернули идею системного устройства внимания в анатомические сети — дорсальную (целеполагающую, top-down) и вентральную (реагирующую, bottom-up) — что оказалось чрезвычайно плодотворным для интерпретации fMRI и поведенческих данных. Параллельно работы на животных (single-unit) позволили связать эти сетевые концепции с конкретными физиологическими механизмами (gain-модуляция, normalization). (PubMed, PMC, cns.nyu.edu)

Ключевые переходы: (i) парадигмы → интерпретация через fMRI/EEG/MEG, (ii) физиология → конкретные клеточные механизмы (gain, normalization), (iii) интервенционные методы (TMS/optogenetics) — для причинностной верификации. (PMC, cns.nyu.edu)


1.3. Сравнение определений в нейронауке и в машинном обучении (чем «внимание» в ML отличается от биологического)

В машинном обучении «внимание» появилось как инженерно-вычислительная конструкция — механизм динамического взвешивания входных представлений для фокусировки вычислительной мощности на релевантных частях входа. Ранние формализации — soft-attention в последовательных моделях (Bahdanau et al., 2014) — дали «дифференцируемый» способ выравнивания входа и выхода; затем архитектурный сдвиг был сделан в Vaswani et al. (2017), где self-attention стал центральным блоком трансформеров: внимание там реализуется через матричные операции (Q,K,V, scaled dot-product + softmax), мульти-хэды и слои нормализации — и служит для маршрутизации информации внутри сети без биологической интерпретации нейронных механизмов. (arXiv)

Главное сходство — концептуальная идея «взвешивания/маршрутизации» релевантных входов; главное различие — уровень абстракции и ограничения. Биологическое внимание интегрирует временные масштабы, нейромодуляторную регуляцию, ограничения энергии и латентности, фазовую структуру осцилляций и причинностные механизмы маршрутизации (например, пулвинар как переключатель межкортикальной связи). Модели ML, напротив, выражают внимание как числовую математику (матрицы весов, softmax), оптимизируемую градиентным спуском, без явной априорной привязки к биофизическим свойствам нейронов. Это даёт ML-системам мощь и вычислительную гибкость, но также создаёт разрыв в понимании — какие аспекты attention-механизмов в трансформерах соответствуют реальным биологическим механизмам, а какие — чисто функциональные эвристики. (arXiv, Wiley Online Library, PMC)

Последние обзоры (включая обзоры, связывающие трансформеры и нейронауку, 2023–2024 гг.) активно исследуют мосты между этими уровнями: какие элементы трансформера можно сопоставить с нормализацией/гейном, как ввести временные и энергоограничения в attention-модули и как использовать трансформеры как инструменты анализа нейронных данных (encoding/decoding, выделение релевантных паттернов). Эти работы подчёркивают две практические вывода: (i) использовать ML-attention как формализм для гипотез о маршрутизации и (ii) не редуцировать биологическое внимание к простым attention-весам без дополнительных динамических и биофизических уточнений. (Wiley Online Library, cns.nyu.edu)

Вкратце: ML-attention = мощный, формализованный механизм взвешивания/маршрутизации в вычислительной среде; биологическое внимание = многоуровневый, динамический механизм с биофизическими ограничениями и нейромодуляторной регуляцией. Синтез этих представлений — ключ к построению объяснительных и прикладных мостовых моделей. (arXiv, PMC)


Источники

  • Broadbent D. E. (1958). Perception and Communication. (модель фильтра). (pure.mpg.de)
  • Treisman A. (1964). Selective Attention in Man. Br Med Bull. (attenuation). (PubMed)
  • Posner M. I., Petersen S. E. (1990). The attention system of the human brain. Annu Rev Neurosci. (карта систем внимания). (PubMed)
  • Kahneman D. (1973). Attention and Effort. (ресурсо-модель). (Amazon Web Services, Inc.)
  • Reynolds J. H., Heeger D. J. (2009). The Normalization Model of Attention. Neuron. (модель gain/normalization). (Cell)
  • Fries P. (2005). Communication through coherence. Trends Cogn Sci. (синхронность). (PubMed)
  • Bahdanau D., Cho K., Bengio Y. (2014). Neural Machine Translation by Jointly Learning to Align and Translate. (soft attention). (arXiv)
  • Vaswani A., et al. (2017). Attention Is All You Need. (Transformer/self-attention). (arXiv)

2. Нейроанатомия и крупные сети внимания

Краткий ввод — многокомпонентная организация

Внимание реализуется не одной «локальной» областью мозга, а распределённой, многоуровнeвой системой, включающей корковые и подкорковые узлы, а также нейромодуляторные проекции. На анатомическом уровне выделяются по крайней мере три взаимодействующие подсистемы: (1) кортикальные сети, обеспечивающие целенаправленное (top-down) и стимул-зависимое (bottom-up) управление; (2) подкорковые «маршрутизаторы» (таламус, базальные ганглии, верхние ретикулярные структуры), которые динамически переформатируют поток информации; (3) проекции нейромодуляторов (ацетилхолин, норадреналин, дофамин и др.), которые задают тонус, точность (precision) и пластичность обработки. Эта многокомпонентная архитектура объясняет, почему эффекты внимания проявляются на самых разных уровнях — от изменения firing-rate отдельных нейронов до изменения межрегиональной синхронности и поведения. (Nature, PMC)


2.1. Системы внимания в мозге: дорсальная (top-down) и вентральная (bottom-up) сети; роль лобно-париетальных связей

Дихотомия дорсальной/вентральной систем. Классическая и наиболее влиятельная крупномасштабная схема — разделение внимания на дорсальную (dorsal attention network, DAN) и вентральную (ventral attention network, VAN) системы. DAN (включая интрапариетальную борозду / IPS, фрагменты верхней лобной извилины и фронтальные области, в т.ч. FEF) поддерживает поддерживаемое, целенаправленное распределение внимания (top-down), тогда как VAN (включая темпоро-париетальную переходную область TPJ и вентральную латеральную префронтальную кору) обслуживает обнаружение неожиданных, поведенчески релевантных стимулов и служит «аварийным выключателем» для перераспределения ресурсов (bottom-up / stimulus-driven). Эта схема подтверждена fMRI-данными, мета-анализами и клиническими наблюдениями (асимметрия при геминеgлект и т. п.). (Nature, PMC)

Лобно-париетальные связи как исполнительная магистраль. Лобная кора (включая фронтальные глазодвигательные поля — FEF — и латеральный префронтальный кортекс) тесно связана с париетальной корой (IPS/LIP) и сенсорными зонами; эти связи реализуют топ-даун сигналы, которые модифицируют селективность и усиление ответов в сенсорных областях (маркирование «куда/что» фокусировать внимание). Электрические стимуляции и локальные интервенции (TMS, фармакологические манипуляции) показывают, что нарушение лобно-париетальных узлов приводит к специфическим дефицитам в направленном внимании и в селективной обработке. (PMC)

Динамическая координация и пластичность сети. Современные исследования (resting-state и task-fmri, а также мультимодальные анализы) подчёркивают, что сеть внимания не статична: топ-down и bottom-up компоненты взаимодействуют в зависимости от задачевой установки, ожиданий и контекста. Недавние большие обзоры описывают подкорковую и нейромодуляторную интеграцию как ключевой фактор, задающий переключаемость между глобальными состояниями сети. (Nature, PMC)


2.2. Подкорковые влияния: таламус (особенно LP / pulvinar), базальные ганглии, ретикулярная формация

Таламус / pulvinar как роутер межкортикальной передачи. Таламус — не просто «перекрёсток» сенсорных проекций; высшие таламические ядра (в частности pulvinar у приматов) играют активную роль в координации активности между кортикальными участками в зависимости от распределения внимания. Электрофизиологические и кросс-кортикальные записи показали, что pulvinar синхронизирует осцилляторные фазы и согласовывает коррелированную активность между визуальными и фронто-париетальными областями при выполнении задач внимания, что позволяет ему действовать как «динамический переключатель» межрегионального обмена информацией. Эти результаты подтверждены причинно-следственными манипуляциями (частичная деактивация/оптогенетика в животных), что подчёркивает его функционально-регуляторную роль. (PubMed, PMC)

Базальные ганглии — «фильтр» ценности и контекстной направленности. Классически базальные ганглии (BG) ассоциируются с моторным контролем и обработкой вознаграждения; однако накопленные данные показывают, что BG также участвуют в селективной обработке и маршрутизации перцептуальной информации: они интегрируют кортикальные сигналы разных уровней, кодируют ценность/приоритет и через таламо-кортикальные петли могут изменять, «разрешать» или «блокировать» передачи, тем самым влияя на то, какая информация получает приоритет для дальнейшей обработки. Новые обзоры последних лет суммируют доказательства анатомических связей и функциональных влияний BG на восприятие и внимание у людей и животных. (PMC)

Ретикулярная формация и ствол мозга — уровень арousal и глобальной готовности. Ретикулярная формация ствола мозга (включая ядра, регулирующие сон/бодрствование и спиральную активность) задаёт фоновые параметры возбудимости коры; её влияние проявляется через модуляцию уровня арousal, который критически влияет на способность системы поддерживать селективное внимание и переключаться между задачами. Патологии ствола и возраст-зависимые изменения в этих системах коррелируют с нарушениями в sustained attention и контролируемых переключениях. (NCBI, PMC)


2.3. Нейромодуляторы (ацетилхолин, норадреналин, дофамин) — их роль в регулировании сигнал/шум и пластичности

Ацетилхолин (ACh). Химические проекции из базального мозга (nucleus basalis of Meynert и другие) широко иннервируют кору и оказывают сильную модулляторную роль в задачах внимания. ACh ассоциирован с повышением чувствительности к внешним сигналам, улучшением детекции и снижением фоновного шума, а также с улучшением сигнал/шум-отношения в сенсорной коре; экспериментальные данные на животных и в клинике подтверждают влияние холинергической передачи на performance в задачах селективного внимания. Обзоры по роли ACh в когнитивном контроле суммируют как фази-специфические, так и рецептор-зависимые эффекты (никотиновые и мускариновые системы). (PMC)

Норадреналин (LC-NE). Локус церулеус (LC) и его норадренергические проекции участвуют в регулировании реактивности и «адаптивного усиления» (adaptive gain) — гипотеза, предложенная Aston-Jones & Cohen, согласно которой фоновая активность LC регулирует переключение между режимами эксплорации и эксплуатацией и оптимизирует поведенческую производительность. LC-NE повышает общую возбудимость сети и может временно увеличивать точность сигналов, способствуя улучшенной детекции и реакции на важные стимулы. Современные обзоры подчёркивают сложную, дифференцированную роль LC в зависимости от локуса активности, фаз циклов и контекста задач. (Annual Reviews, PMC)

Дофамин (DA). Дофаминовые пути (VTA / SNc → PFC / струнатум) участвуют в модуляции целенаправленных сигналов и рабочей памяти; экспериментальные вмешательства показывают, что D1-рецепторная активность в префронтальной коре (например, во фронтальных глазодвигательных полях) может усиливать топ-down контроль и изменять качество визуальных сигналов в V4, что напрямую связывает дофамин с механизмами селективного усиления и контроля внимания. Дофамин также функционирует в интерфейсе мотивации/ценности — важном компоненте при выборе, куда направлять ресурсы внимания. (PMC, Frontiers)

Взаимодействие модулей. Эти нейромодуляторные системы не работают независимо: ACh, NE, DA (и серотонин) взаимодействуют в сложных временных и рецепторно-специфичных режимах, задавая уровень чувствительности, вариабельности и пластичности. Современные модели обращения с attention рассматривают neuromodulation как ключевой механизм, который задаёт «precision» в Bayesian/predictive coding схемах и определяет, какие предсказания/сигналы будут усилены. (PMC, ScienceDirect)


2.4. Локализация в сенсорных областях: V1 → V4 → IT и корреляты пространственного / фичевого / объектного внимания

Модуляция ответов в ранней и промежуточной визуальной коре. Классические одно- и многоканальные записи показали, что внимание модифицирует ответы в визуальных областях на уровне single-unit и population activity. Moran & Desimone (1985) продемонстрировали, что внимание повышает ответы нейронов в экстрастрирейтной коре (V4/IT) к целевому стимулу и «подавляет» ответы к отвлекающим стимулам, фактически действуя как селективный «весовой» механизм. Последующие исследования показали, что в V4 внимание часто проявляется как мультипликативное увеличение (gain) и как улучшение надёжности ответов нейронов; в V1 эффекты могут быть более тонкими и зависеть от стимульных условий и задачевой установки. (PubMed)

Фичевое и объектное внимание. Помимо пространственной селекции, внимание может усиливать репрезентации определённых признаков (цвет, направление движения) или целых объектов. Эксперименты демонстрируют, что feature-based attention даёт глобальное усиление соответствующих признаковых каналов по всему визуальному полю, тогда как object-based attention способствует целостной селекции свойств, принадлежащих одному выделенному объекту. На уровне коры это проявляется в сдвиге спектральной селективности, усилении отклика и изменениях корреляции между нейронами. (Cell, PNAS)

Нормализация как общий механизм. Нормализационные модели (Reynolds & Heeger, 2009) обеспечивают единую формальную рамку, способную объяснить ряд эмпирических эффектов: как при разных конфигурациях стимулов внимание может выглядеть как усиление gain, сдвиг базовой линии или изменение selectivity. Нормализация согласуется с результатами по V1–V4–IT и предлагает количественные предсказания о том, как изменения «поля внимания» приводят к изменениям ответов в разных областях зрительной и высших областях. (PMC, PubMed)


Интегративные замечания и открытые вопросы (в контексте анатомии)

  1. Кто «главный»? — вопрос о том, является ли кортикальный top-down контроль первичным по отношению к подкорковым маршрутизаторам (pulvinar, BG) остаётся дискуссионным; данные указывают на совместную и рекуррентную организацию: корковые области инициируют топ-down сигналы, но подкорковые узлы критически важны для маршрутизации и синхронизации. (PMC)
  2. Какой вклад нейромодуляторов доминирует в конкретных задачах? — ACh, NE и DA имеют перекрывающиеся, иногда контрастные функции; нужна более прямая межметодная верификация (одновременные манипуляции и запись активности на больших масштабах). (PMC)
  3. Вопрос причинности. — хотя наблюдательная фМРI/электрофизиология дала богатую картину корреляций, для установления причинности требуются интервенционные подходы (оптогенетика, временно-локальные фармакологические манипуляции, таргетный TMS), особенно в комбинированных мульти-модальных протоколах. (PMC)

Источники

  • Corbetta M., Shulman G. L. (2002). Control of goal-directed and stimulus-driven attention in the brain. Nat Rev Neurosci. DOI:10.1038/nrn755. (Nature)
  • Vossel S., Geng J. J., Fink G. R. (2014). Dorsal and ventral attention systems: distinct neural circuits but collaborative roles. Trends Cogn Sci / PMC review. (PMC)
  • Saalmann Y. B., Pinsk M. A., Wang L., Li X., Kastner S. (2012). The pulvinar regulates information transmission between cortical areas based on attention demands. Science. DOI:10.1126/science.1223082. (Наука, PMC)
  • Reynolds J. H., Heeger D. J. (2009). The normalization model of attention. Neuron. DOI:10.1016/j.neuron.2009.01.002. (PMC)
  • Moran J., Desimone R. (1985). Selective attention gates visual processing in the extrastriate cortex. Science. DOI:10.1126/science.4023713. (PubMed)
  • Noudoost B., Moore T. (2011). Control of visual cortical signals by prefrontal dopamine. Nature/PMC. (PMC)
  • Reviews on neuromodulators and attention: Klinkenberg et al. (2011); Parikh & Sarter (2020); Aston-Jones & Cohen (2005); McBurney-Lin et al. (2019). (ScienceDirect, PMC, Annual Reviews)
  • Recent reviews on BG contributions and subcortical networks: Redinbaugh et al. (2024) Contributions of Basal Ganglia Circuits to Perception; Alves et al. (2022) Subcortical and neurochemical organization of DAN (open access). (PMC, Nature)

3. Клеточные и синхронные механизмы

Введение — почему уровень клеток и синхронизации важен для понимания внимания

Эффекты «внимания» наблюдаются не только на поведенческом уровне и в межрегиональных BOLD-корреляциях: многие классические феномены (улучшение обнаружения, смещение селективности, подавление отвлекающих стимулов) имеют прямые физиологические корреляты — изменение firing-rate отдельных нейронов, изменение дисперсии и корреляции между нейронами, а также изменение временной структуры сигналов (осцилляции, фаза-зависимый код и мульти-временные шкалы). Понимание этих механизмов позволяет связать макро-уровневые теории (top-down vs bottom-up, biased competition) с физическими реализующими процессами в сети. (PubMed, PMC)


3.1 Усиление ответа (gain modulation) vs селективная фильтрация

Постановка проблемы. Наблюдаемые при внимании изменения в нейронных ответах часто описывают двумя метафорами: (i) усиление отклика (gain modulation) — когда ответ нейрона на предпочитаемый стимул умножается на некоторый множитель при фокусе внимания; (ii) селективная фильтрация / конкуренция — когда представления конкурируют за представление, и внимание «смещает» конкурентное равновесие в пользу релевантного стимула. Эти два описания не всегда взаимоисключающие; важна их количественная формулировка и контекст (какие стимулы представлены, плотность отвлекающих стимулов, параметры задач). (PMC, PubMed)

Эмпирические данные. Ранние единичные записи продемонстрировали, что внимание повышает firing-rate в экстрастриатной коре (V4/MT и т.д.) для аттендед-стимула (Moran & Desimone, 1985), а исследования фичевого внимания (Treue & Maunsell и последующие работы) показали глобальное усиление каналов, соответствующих атрибуту (feature-based gain). В некоторых условиях внимание проявляется как почти чистое мультипликативное увеличение (gain), в других — как более сложное перераспределение активации, включающее подавление отвлекающих сигналов и сдвиг selectivity. (PubMed)

Единая формализация — Normalization model. Нормализационная модель внимания (Reynolds & Heeger, 2009) объединила эти наблюдения: внимание моделируется как изменение входных весов (включая усиление целевого сигнала), на которое затем накладывается divisive normalization — дробная операция, корректирующая суммарную входную энергию сети. В зависимости от соотношения размеров и контраста стимулов модель воспроизводит наблюдаемые эмпирические паттерны — от чистого gain до «эффекта подавления» при высоком числе конкурирующих стимулов. Этот подход даёт количественные предсказания и связывает феноменологию усиления/фильтрации с конкретными вычислительными операциями. (PMC)

Интерпретация и ограничения. Нормализация объясняет множество результатов, но не исчерпывает роли временной синхронизации и нейромодуляторов: gain-модуляция может быть реализована через фоновую возбудимость, рецепторные механизмы или фазовую синхронизацию; фильтрация же — через межнейронные конкуренции и кортико-таламические петли. Таким образом, «gain vs filter» — это не выбор между двумя альтернативами, а вопрос о доминирующих механизмах в конкретной задаче/режиме. (PMC)


3.2 Нейронная синхронизация и Communication-Through-Coherence (CTC)

Идея CTC. Гипотеза «communication through coherence» (Fries, 2005; обновлённая формулировка 2015) утверждает, что эффективная передача сигналов между областями зависит не только от среднего firing-rate, но и от согласованности фаз осцилляций между источником и приёмником: когда входные спайки приходят в «возбудимую фазу» постсинаптической осцилляции у принимающей популяции, вероятность эффективной передачи возрастает. Таким образом, синхронизация по фазе (на определённой частоте) действует как динамический «ключ» для маршрутизации информации. Эта гипотеза объясняет многие наблюдения, где при внимании увеличивается межрегиональная когерентность и специфическая фазовая синхронность между фронтальными/париетальными и сенсорными областями. (PubMed, PMC)

Эмпирические данные. Многочисленные LFP/EEG/MEG и многоканальные single-unit исследования показывают, что при внимании увеличивается когерентность в бета- и гамма-диапазонах между фронто-париетальными и сенсорными зонами; одновременные записи в pulvinar и коре демонстрируют изменение синхронизации, коррелирующее с улучшением поведенческой эффективности. Рандомизированные интервенции (стимуляция, фармакология) также демонстрируют, что сдвиг или подавление синхронности влияет на передачу и поведение. (PMC, ScienceDirect)

Критика и нюансы. Несмотря на привлекательность CTC, существуют дискуссии: (i) какие частоты критичны для каких задач и областей (альфа для подавления, гамма для локальной передачи и т.д.); (ii) насколько стабильны осцилляторные ритмы в естественных условиях (многие LFP сигналы апериодичны и проявляют «1/f» компонент), что ставит под вопрос простую картину ритм-фазы как «ключа»; (iii) корреляция фазы и передачи не всегда доказывает причинность. Тем не менее, обновлённые обзоры формулируют CTC как одну из главных операционных гипотез о временной организации коммуникации в мозге. (PMC)


3.3 Нормализационные механизмы и их роль в объяснении эффектов внимания (Normalization model)

Формулировка модели. Нормализационная модель (Reynolds & Heeger, 2009) представляет нейронный ответ как произведение линейной фильтрации (включая входные веса, которые могут быть модулированы вниманием) и делителя, равного сумме активностей популяции плюс константы (divisive normalization). Формально это даёт возможность объяснить, почему при одних условиях внимание выглядит как мультипликативный gain, а при других — как дифференциальное подавление/перекрытие. Модель успешно воспроизводит большое число наблюдаемых физиологических эффектов и предсказывает экспериментальные зависимости от контраста, размера поля внимания и плотности конкуренции. (PMC)

Почему нормализация — мощный «мост». Нормализация — распространённый операционный механизм в сенсорных системах (не только при внимании): она стабилизирует коды, предотвращает насыщение, обеспечивает контекстную селекцию и реализуется биофизически через равновесие возбуждения/ингибиции и краткосрочные синаптические механизмы. При внимании изменение «входных коэффициентов» (attentional gain) в рамках нормализации даёт гибкий способ направления ресурсов без разрушения общей кодовой стабильности. (PMC)

Ограничения и пути развития. Нормализация сама по себе статична; чтобы описать динамические переключения и фазо-зависимые эффекты, модель нужно расширять: добавлять временные фильтры, осцилляторные компоненты, рекуррентную динамику и нейромодуляторную регуляцию. Многие современные работы объединяют нормализацию с динамическими аттракторными или фазовыми механизмами, чтобы покрыть полный спектр наблюдаемых феноменов. (PMC, PubMed)


3.4 Временные аспекты: фазовая кодификация, латентные ансамбли, мульти-временные шкалы

Фазовая кодификация и её разновидности. Фаза осцилляций может служить «средой» для упорядочивания спайковых сообщений (phase coding), позволяя представлять информацию не только в firing-rate, но и во времени относительно осцилляторного цикла. Это особенно важно при конкуренции сигналов: попадание в «окно повышенной возбудимости» даёт приоритет передаче. Современные исследования показывают, что фазовая информация может быть обнаружена и в условиях слабых ритмов (broadband LFP), а не только при чистых периодических генерациях. (PMC, ScienceDirect)

Латентные ансамбли и динамические траектории. Анализ популяционной активности (population dynamics) выявил, что нейронные коды часто организованы не как статические репрезентации, а как траектории в высокоразмерном латентном пространстве (latent manifolds). Исследования, например в PFC, показали, что задачи, требующие гибкой селекции и интеграции, реализуются через контекст-зависимые траектории и переключения между аттракторами — что согласуется с идеей, что внимание может «сдвигать» систему на другую траекторию представления. Такие работы подчёркивают важность рекуррентной динамики и временной структуры популяций для реализации селективности. (PubMed, PMC)

Мульти-временные шкалы (intrinsic timescales). Разные области мозга характеризуются разными «внутренними» временами интеграции (intrinsic neural timescales): сенсорные зоны — быстрые, ассоциативные и фронтальные — медленные. Эти различия позволяют реализовывать одновременно быстрое реагирование на новые стимулы и поддержание информации (sustained attention, рабочая память). Внимание может динамически изменять локальные времена интеграции (например, удлиняя время интеграции в областях, отвечающих за текущую задачу), что согласуется с наблюдаемыми изменениями в autocorrelation и в поведенческой эффективности. (Nature, PMC)

Связь времен и синхронизации. Фазовые механизмы, латентные траектории и мульти-временные шкалы — не отдельные явления, а взаимосвязанные уровни временной организации: фазовая синхронизация упорядочивает спайковую активность в коротких окнах; латентные траектории отражают рекуррентную интеграцию на промежуточных временах; intrinsic timescales задают способность области участвовать в долговременных операциях. Полноценная теория внимания должна учитывать все эти уровни. (PMC, PubMed, Nature)


Краткое резюме и открытые вопросы

  • Gain vs filter. Усиление отклика (gain) и селективная фильтрация (biased competition) — обе корректные и эмпирически обоснованные метафоры; нормализационная формализация даёт методально-чёткий мост между ними. (PMC, PubMed)
  • Временная организация критична. Фазовая синхронизация (CTC), латентные популяционные траектории и мульти-временные шкалы вместе объясняют, как внимание может гибко маршрутизировать информацию в реальном времени. (PMC, PubMed, Nature)
  • Необходимы причины, не только корреляции. Для демонстрации причинных механизмов требуются комбинированные подходы: оптогенетика/стимуляция + мульти-электродные записи + поведенческие манипуляции. (ScienceDirect, PMC)

Открытые вопросы (выборка). Как именно реализуется divisive normalization на микросхеме E/I-контроля при разных состояниях внимания? Какие частоты и фазы критичны в естественных условиях (в задачах с естественным зрением)? Как латентные манифолды реорганизуются при обучении и как это влияет на долговременные изменения внимания? Эти вопросы определяют дорожную карту экспериментальных исследований на ближайшие годы. (PMC, PubMed)


Источники

  • Moran, J., & Desimone, R. (1985). Selective attention gates visual processing in the extrastriate cortex. Science. DOI: 10.1126/science.4023713. — Один из первых отчетов о том, что внимание повышает firing-rate в V4/экстрастритальной коре и «гейтирует» обработку. (PubMed)
  • Salinas, E., & Sejnowski, T. J. (2001). Gain Modulation in the Central Nervous System. — Обзор механизмов gain-modulation и их вычислительного значения. (PMC)
  • Treue, S., & Maunsell, J. H. R. (1996). Attentional modulation of visual motion processing in cortical areas MT and MST. Nature / J Neurosci et al. DOI: (см. PubMed). — Ранняя демонстрация feature- and space-based gain в визуальной системе. (PubMed)
  • Reynolds, J. H., & Heeger, D. J. (2009). The Normalization Model of Attention. Neuron. DOI: 10.1016/j.neuron.2009.01.002. — Ключевая формализация, связывающая gain и нормализацию. (PMC)
  • Fries, P. (2005). A mechanism for cognitive dynamics: neuronal communication through neuronal coherence. Trends in Cognitive Sciences. DOI: 10.1016/j.tics.2005.08.011. (Обновлённая формулировка: Fries 2015). — Формулировка CTC; обзор эмпирических подтверждений и предсказаний. (PubMed, PMC)
  • Mante, V., Sussillo, D., Shenoy, K. V., & Newsome, W. T. (2013). Context-dependent computation by recurrent dynamics in prefrontal cortex. Nature. DOI: 10.1038/nature12742. — Пример популяционной динамики и латентных траекторий, релевантных гибкой селекции. (PubMed)
  • Bush, D., et al. (2020). Advantages and detection of phase coding in the absence of rhythmicity. (PMC). — Обсуждение фазовой кодировки в реалистичных LFP условиях. (PMC)
  • Zeraati, R., et al. (2023). Intrinsic timescales in the visual cortex change with cognitive state. Commun Biol. — Примеры изменений внутренних временных шкал в зависимости от когнитивного состояния. (PMC)

4. Типы внимания и их парадигмы

4.1. Пространственное vs фичевое vs объектное внимание — определения и нервные корреляты

Пространственное внимание (spatial attention). Пространственное внимание направляет ресурсы на локус в пространстве (координаты визуального поля или аудиопространства). Оно повышает детектируемость и скорость реакции на стимулы в аттендед-позиции, сопровождается изменениями в корковых картографиях (смещение receptive fields, усиление firing-rate в представительных нейронных популяциях) и вовлечением дорсальной лобно-париетальной сети (FEF, IPS/LIP). Пространственное внимание часто моделируется как «фокус» с ограниченной шириной и перемещаемым центром. (PMC)

Фичевое внимание (feature-based attention). Фичевое внимание усиливает представления определённых признаков (цвет, направление движения, ориентация) по всему полю зрения независимо от их пространственного положения. На физиологическом уровне наблюдается глобальное усиление каналов, чувствительных к выбраной фиче (feature-based gain), и изменения корреляции популяционных кодов. Фичевое внимание также задействует фронто-окципитальные взаимодействия, но даёт иные паттерны модуляции по сравнению с пространственным вниманием. (PMC, SpringerLink)

Объектное внимание (object-based attention). При объектном внимании селекция идёт по целостным объектам — все признаки, принадлежащие одному объекту, обрабатываются приоритетно. Это проявляется в том, что внимание, направленное на часть объекта, автоматически распространяется на другие части того же объекта (object-based spread), и в нейрофизиологии — как координированное усиление нейронных ансамблей, кодирующих свойства объекта. Объектное внимание часто рассматривается как промежуточный класс между пространственным и фичевым типами, с собственной динамикой взаимодействия. (Nature, PMC)

Ключевая эмпирическая находка. Современные данные показывают, что пространственное, фичевое и объектное внимание опираются на частично пересекающиеся, но различающиеся механизмы и сети — пример: пространственное внимание даёт сильную локализованную модуляцию в визуальной коре, а фичевое внимание — более глобальное усиление признаковых каналов; нейробиологические различия подтверждены как записью нейронов, так и fMRI/MEG исследованиями. (PMC)


4.2. Селективное/избирательное, устойчивое (sustained), переключаемое (shifting), когнитивное (executive) внимание — функциональные профили

Селективное (selective) / избирательное внимание. Обобщающий термин для механизмов, которые выбирают одну из конкурирующих репрезентаций на основе релевантности; включает пространственную, фичевую и объектную формы. Селективное внимание изучается через задачи с конфликтом стимулов (visual search, distractor paradigms) и коррелирует с модуляциями в лобно-париетальных контролирующих узлах и локальными изменениями в сенсорных картах. (Поиск Харварда)

Устойчивое внимание (sustained / vigilance). Способность поддерживать цель-ориентированное состояние и детектировать редкие/непредсказуемые события длительное время. Нарушения проявляются в падении производительности (vigilance decrement) и ассоциированы с системами бодрствования / arousal (ретикулярная формация, LC-NE) и фронтальными поддерживающими узлами. Современные обзоры подчёркивают мультифакторную природу устойчивости: мотивация, нагрузка, монотонность и нейромодуляторы делают существенный вклад. (PMC, ScienceDirect)

Переключаемое внимание (shifting / switching). Процесс быстрой смены фокуса внимания между локусами, признаками или задачами; вовлекает механизмы репрессии предыдущего фокуса и активации нового, опирается на лобно-париетальную сеть и исполнительные узлы (PFC), а также на межрегиональную синхронизацию для быстрой реконфигурации. (PMC)

Когнитивное / исполнительное внимание (executive attention). Включает контроль над распределением ресурсов, подавление конфликтных/нежелательных реакций и управление рабочей памятью; сильно зависит от латерального PFC и связанных исполнительных сетей. Executive attention тесно связан с управлением задач и с контролем переключения/устойчивости. (PMC)


4.3. Экспериментальные парадигмы: Posner cueing, visual search, RSVP, attentional blink, dichotic listening — что измеряют и как интерпретировать

Posner cueing. Классическая парадигма ориентирования пространства: предварительные указатели (cues) информируют о вероятном положении цели; сравнение валидных/невных/нейтральных условий даёт оценку скорости и точности пространственного перенаправления внимания и латентности установки фокуса. Posner-cueing легко комбинируется с нейровизуализацией и служит «рабочим конём» для исследований топ-даун/боттом-ап ориентации. Ограничения: влияние ожидания и вероятности (cue validity) — важные модераторы эффекта. (PMC, Journal of Vision)

Visual search. Задача поиска цели среди множества отвлекающих элементов; ключевые индикаторы — наклон RT по числу стимулов (set size), влияние разделения признаков (feature vs conjunction search). Модель Guided Search (Wolfe) остаётся центральной: поиск — это комбинация параллельной ранней обработки и селективного последовательного обзора, управляемого «guiding template». Visual search измеряет способность селективного выделения и роль приоритетных карт внимания. (Поиск Харварда, PubMed)

RSVP и Attentional Blink (AB). Rapid Serial Visual Presentation (RSVP) последовательность стимулов служит для исследования временных ограничений внимания. «Attentional blink» — резкое падение способности замечать второй целевой стимул (T2) если он следует 200–500 мс после первого (T1); AB исследует временную емкость и процессы кодирования в рабочую память. Теоретические объяснения включают перегрузку кодирования, временную фильтрацию и контроль ресурсов. (SpringerLink, ScienceDirect)

Dichotic listening. Акустическая парадигма, где разные стимулы подаются на каждое ухо; с инструкцией «внимай левому/правому» исследуют селективную аудиторную обработку, обработку речи и эффекты автоматического семантического доступа (например, узнавание собственного имени в неаттендед-канале). Парадигма использована для изучения латерализации и кортикальных аудиторных механизмов внимания. (PMC)

Интерпретационные замечания. Каждая парадигма измеряет специфический аспект внимания (пространство, время, признаки, слух) и имеет свои методические ограничения (например, влияние мотивации в sustained tasks, эффекты вероятности в cueing). Комбинированные подходы (например, RSVP + neuroimaging; visual search + single-unit) — наиболее информативны для связки поведения и нейрофизиологии. (PMC, Поиск Харварда)


4.4. Мультисенсорное внимание и межмодальная интеграция

Принципы. Мультисенсорное внимание изучает, как внимание распределяется между и внутри сенсорных модальностей и как она влияет на интеграцию сигналов (MSI — multisensory integration). Внимание может усиливать интеграцию (повышая веса согласованным кросс-модальным сигналам) или, напротив, рассекать интеграцию при конкурирующих задачах. Нейронно это отражается в гибкой совместной активации полей ассоциативной коры (STG, IPS, PPC) и в изменениях временной координации между модальностями. (SAGE Journals, ScienceDirect)

Развитие и контекст. Считается, что мультисенсорные механизмы начинают формироваться пренатально и продолжают развиваться в раннем детстве; контекстуальные фактори (задача, ожидания, фоновые шумы) сильно определяют, когда и как внимание поддерживает мультисенсорную интеграцию. Недавние обзоры подчёркивают нужду в более прецизионных парадигмах и в учёте временных окон интеграции. (PMC, ScienceDirect)


Краткое резюме и практические рекомендации для исследований

  1. Выбор парадигмы должен следовать вопросу. Хотите изучать временные ограничения — используйте RSVP/AB; пространственную селекцию — Posner/visual search; устойчивость — длительные vigilance-таски; мультисенсорность — комбинированные стимулы с кросс-модальными условиями. (PMC, Поиск Харварда)
  2. Комбинируйте методы. Поведенческие эффекты сами по себе недостаточны для вывода о механизмах; добавляйте neuroimaging / electrophysiology / neuromodulatory manipulations для причинных интерпретаций. (PMC)
  3. Учёт индивидуальных и контекстных факторов. Мотивация, опыт, инструкции и статистика стимулов (probabilities, cue validities) сильно влияют на проявления внимания — при проектировании эксперимента контролируйте эти факторы. (Поиск Харварда, ScienceDirect)

Источники

  • Goddard E., et al. (2022). Spatial and Feature-selective Attention Have Distinct Neural Mechanisms. PMC. (PMC)
  • Wolfe J. M. (2020). Visual Search: How Do We Find What We Are Looking For? Annual Review of Vision Science. (Поиск Харварда)
  • Hayward D. A. (2013). Measuring attention using the Posner cuing paradigm. PMC. (PMC)
  • Dux P. E., & Marois R. (2009). The attentional blink: A review of data and theory. Psychol Bull. (SpringerLink)
  • Huang H., et al. (2023). A review of visual sustained attention: neural mechanisms and measurement. PMC. (PMC)
  • Hugdahl K., et al. (2000). Effects of attention on dichotic listening: A PET study. PMC. (PMC)
  • Tang X., et al. (2016). The interactions of multisensory integration with attention. Trends in Cognitive Sciences. (ScienceDirect)
  • Choo C. M., et al. (2025). Brain imaging studies of multisensory integration (scoping review). (ScienceDirect)

5. Вычислительные теории внимания в нейронауке

Коротко: вычислительные теории стремятся формализовать что делает внимание (какие вычисления, какую роль играет в кодировании и маршрутизации информации) и как эти вычисления могли бы быть реализованы нейронными аппаратами. Основные семейства — biased competition, normalization / gain-control, Bayesian / predictive coding (precision) и динамические/аттракторные модели (рекуррентные сети и латентные траектории). Эти подходы частично перекрываются и часто комбинируются в современных гибридных моделях. (PubMed, PMC)


5.1. Biased competition (Desimone & Duncan) — логика конкуренции представлений

Идея. Входящие сенсорные представления конкурируют за ограниченные вычислительные ресурсы и доступ к последующим этапам обработки. Внимание «смещает» эту конкуренцию, повышая конкурентоспособность релевантных представлений (bias), тем самым «гарантируя» их прохождение и дальнейшую обработку. Это качественная, но мощная метафора, которая хорошо согласуется с записью нейронов в визуционной коре: при нескольких конкурирующих объектах ответ нейрона смещается в сторону аттендед-стимула. (PubMed)

Простая формализация (интуитивная). Пусть множество представлений ${r_i}$ конкурирует за ограниченный выходной ресурс $R$. Biased competition вводит параметр $b_i$ (bias), который увеличивает вес некоторого $r_k$: $\tilde r_i = b_i \cdot r_i$. Затем механизм селекции выбирает элементы с наибольшей $\tilde r_i$ для дальнейшей обработки. Такая схема описывает эффект «подавления отвлекающих» и «усиления целевого» при наблюдаемой физиологии. (PubMed)

Предсказания и эмпирика. Biased competition предсказывает: (i) при увеличении числа конкурирующих стимулов реакция на целевой стимул должна снижаться (из-за большей конкуренции), (ii) топ-даун сигналы (cueing) изменяют баланс конкуренции ещё до появления стимулов, (iii) экспериментальные вмешательства в лобно-париетальную сеть изменяют bias и, следовательно, решения о приоритете. Эти предсказания подтверждены множественными нейрофизиологическими и fMRI-исследованиями. (PubMed)

Ограничения. Biased competition — в основном дескриптивная парадигма; сама по себе она мало говорит о том, как реализуется bias (через gain, нормализацию, фазовую синхронизацию или нейромодуляторы). Поэтому многие современные модели рассматривают biased competition как функциональную цель, которую реализуют более конкретные вычислительные механизмы (см. ниже). (PubMed)


5.2. Normalization models, gain-control, Bayesian / inference-based и predictive coding

Normalization и gain-control (Reynolds & Heeger)

Ключевая идея. Нормализация — операция, широко наблюдаемая в сенсорных системах: ответ нейронной популяции нормируется делением на сумму активаций популяции (плюс смещение). Reynolds & Heeger (2009) формализовали внимание как изменение входных весов (attentional gain), подвергающихся последующей divisive normalization. Модель способна воспроизводить широкий спектр эмпирических эффектов (различные профили модуляции в зависимости от контраста, размера поля и плотности отвлекающих стимулов). (PubMed, PMC)

Математическая схема (упрощённо). Ответ нейрона $i$:

$$ R_i = \frac{g_i \cdot L_i}{\sigma + \sum_j w_j g_j L_j} $$

где $L_i$ — линейный вход (стимул), $g_i$ — attentional gain на входе, $w_j$ — вклад соседних каналов в нормализатор, $\sigma$ — константа стабилизации. Для разных условий изменения $g_i$ и структуры нормализатора приводят к наблюдаемым паттернам gain-повышения или подавления. (PubMed)

Почему это мощно. Нормализация стабильна, биофизически правдоподобна (реализуется через E/I баланс и синаптические механизмы) и экономична (предотвращает насыщение). Она объясняет, как attention может одновременно усиливать релевантные сигналы и предотвращать разрушение кодов — то есть, обеспечивает компромисс между усилением и стабильностью кодирования. (PubMed)

Bayesian / predictive coding — внимание как модуляция precision

Идея. В рамках predictive coding (или более широко — байесовской теории мозга) мозг непрерывно генерирует предсказания о сенсорных входах; обработка внимания трактуется как модуляция точности (precision) предсказаний и/или предикционных ошибок. Точность — вес, с которым предсказательная ошибка влияет на обновление представлений; она аналогична attentional gain, но выведена из принципов вероятностного вывода. Фристон и соавторы формализовали predictive coding в рамках free-energy / variational inference. (PMC, arXiv)

Как это связать с нормализацией. Precision в predictive coding играет ту же роль, что $g_i$ в normalization models: это множитель, который усиливает (или ослабляет) вклад конкретных каналов/предикционных ошибок. Следовательно, predictive coding и normalization можно рассматривать как взаимодополняющие формализации: одна — из перспективы оптимального вывода (Bayes), другая — из операционной формулы реализуемой на микросхеме (divisive normalization). (PMC, PubMed)

Предсказания и тестирование. Predictive coding делает ряд экспериментальных предсказаний: attention должна повышать нейронную чувствительность к неожиданным (high-precision) сигналам, изменять амплитуды компонент ERP/MEG, и взаимодействовать с нейромодуляторами (которые могли бы кодировать precision). Обширные обзоры/модели показывают согласованность объяснений predictive coding с эмпирикой, но также подчёркивают потребность явной микросхемной реализации (куда вписать precision на уровне рецепторов/синапсов). (PMC, arXiv)


5.3. Модели с сетью временной динамики (аттракторы, динамические системы)

Аттракторные сети и поддержание состояний. Аттракторные модели (Wang, Rolls и др.) показывают, как рекуррентные сети с сильной возбуждающей обратной связью могут поддерживать устойчивые активные состояния (аттракторы), которые соответствуют удержанию информации (working memory) или устойчивому фокусу внимания. В такой картине внимание — это сдвиг ландшафта аттракторов (изменение глубин и барьеров) под влиянием топ-даун сигналов или нейромодуляторов, что позволяет системе «фиксироваться» на релевантной репрезентации и быть робастной к помехам. (cns.nyu.edu, oxcns.org)

Рекуррентная динамика и контекст-зависимая обработка. Работы по анализу популяционной динамики (напр., Mante et al., 2013) показали, что PFC реализует контекст-зависимую обработку через рекуррентные траектории в высокоразмерном латентном пространстве: одна и та же входная стимуляция может привести к разным траекториям/выходам в зависимости от контекста — это модель гибкого routing и выбора информации, близкая по духу к attention-as-routing. Модели RNN, обученные на соответствующих задачах, воспроизводят подобные траектории и дают инструменты для анализа механизма. (Nature, PMC)

Связь с биофизикой. Аттракторные модели объясняют устойчивость рабочей памяти и устойчивого внимания, роль E/I баланса, NMDA-зависимой рекуррентности и влияние нейромодуляторов на «глубину» аттракторов. Они делают конкретные предсказания о времени релаксации (intrinsic timescales), уязвимости к шуму и порогах переключения. (cns.nyu.edu, PMC)

Как объединить аттракторы и normalization / predictive coding. Современные гибридные подходы комбинируют рекуррентную динамику (аттракторы) для поддержания состояния с нормализацией для локального согласования сигналов и с predictive coding для априорных ожиданий — такая композиция покрывает и устойчивое удержание, и гибкое переключение, и модуляцию точности. (Nature, PubMed, PMC)


5.4. Связь вычислительных моделей с физиологическими данными (предсказания и верификация)

Что модели объясняют хорошо.

  • Biased competition корректно описывает поведение нейронов в условиях конкурентных стимулов и согласуется с записями V4/IT при внимании. (PubMed)
  • Normalization model количественно воспроизводит разные типы модулляции (мультипликативный gain vs подавление) и даёт конкретные предсказания по зависимости от контраста/размера стимулов. (PubMed)
  • Predictive coding выдвигает гипотезу о роли precision и согласуется с ERP/MEG эффектами ожидания/неожиданности и с влиянием нейромодуляторов на чувствительность. (PMC)
  • Аттракторные и рекуррентные модели объясняют поддержание информации, переключение и контекст-зависимые вычисления в PFC и дают предсказания о латентных траекториях в популяционной активности. (Nature, cns.nyu.edu)

Экспериментальные тесты и методы. Чтобы верифицировать модели на физиологическом уровне, используют: (i) одновременные мульти-электродные записи (single-unit + LFP) для связывания firing-rate, корреляций и фазовой синхронизации с поведенческими эффектами; (ii) оптогенетику / таргетную фармакологию для установления причинных связей (manipulate gain, NMDA, neuromodulators); (iii) моделирование RNN для восстановления латентных траекторий и проверки, какие архитектурные элементы нужны для воспроизведения данных (training-to-task paradigm). Комбинированный подход — ключ к дифференциации альтернативных механизмов. (PMC)

Проблемы и направления для будущих проверок.

  1. Идентифицируемость параметров. Многие модели имеют параметры (gain, time constants, precisions), которые сложно уникально оценить по данным; необходима многомодальная валидация (спайк + LFP + fMRI + манипуляции). (PMC)
  2. Динамическая интерпретация attention-весов в ML vs биологии. Attention-веса в трансформерах не всегда напрямую соответствуют «нейронным» весам/механизмам; требуется конвергентная экспериментальная стратегия: проектировать ML-задачи и нейрофизиологические протоколы с общими задачами и критериями. (Frontiers)
  3. Микросхемная реализация precision. Predictive coding требует механизмов для кодирования precision — открытый вопрос: каким образом нейромодуляторы и локальные E/I-микросхемы реализуют эти веса. (PMC)

Краткое резюме

  • Biased competition — функциональная цель (конкуренция представлений), хорошо согласуется с физиологией, служит отправной концепцией. (PubMed)
  • Normalization / gain — формализует как реализовать bias; даёт количественные предсказания и биофизическую правдоподобность. (PubMed)
  • Predictive coding / precision — интегрирует внимание в байесовскую оптимизацию: внимание = модуляция весов/точности предсказаний; это даёт теоретическую целостность и связь с neuromodulation. (PMC)
  • Аттракторы и рекуррентная динамика — объясняет устойчивость, переключение и контекстную гибкость; RNN-модели служат мостом между вычислением и латентными популяционными траекториями. (Nature, cns.nyu.edu)

Источники

  • Desimone R., Duncan J. (1995). Neural mechanisms of selective visual attention. Annu. Rev. Neurosci. 18:193–222. DOI: 10.1146/annurev.ne.18.030195.001205. — Классическая формулировка biased competition. (PubMed)
  • Reynolds J. H., Heeger D. J. (2009). The Normalization Model of Attention. Neuron 61(2):168–185. DOI: 10.1016/j.neuron.2009.01.002. — Формализация gain + divisive normalization. (PubMed)
  • Friston K. (2009). Predictive coding under the free-energy principle. Trends Cogn. Sci. / PMC — обзор predictive coding и free-energy framework (вариационная/байесовская трактовка). (PMC)
  • Fries P. (2005). A mechanism for cognitive dynamics: neuronal communication through neuronal coherence. Trends Cogn. Sci. 9(10):474–480. DOI: 10.1016/j.tics.2005.08.011. — Гипотеза CTC о фазовой организации коммуникаций. (PubMed)
  • Mante V., Sussillo D., Shenoy K.V., Newsome W.T. (2013). Context-dependent computation by recurrent dynamics in prefrontal cortex. Nature 503:78–84. DOI: 10.1038/nature12742. — Пример рекуррентных латентных траекторий для контекстной обработки. (Nature)
  • Wang X.-J. (2001/2006). Attractor network models of working memory / decision making. (reviews and models). — Обзор и формализация аттракторных механизмов (см. Wang lab reviews). (cns.nyu.edu, oxcns.org)
  • Huang H., et al. (2023). A review of visual sustained attention: neural mechanisms and computational models. PeerJ / PMC. — Современный обзор вычислительных моделей внимания (2023). (PMC)

6. Внимание в вычислениях и нейросетях (ML)

6.1. Механизмы внимания в ML: от soft-attention к self-attention и трансформерам

История и смысл. В машинном обучении «attention» впервые приобрело широкую известность как дифференцируемый механизм выравнивания в sequence-to-sequence моделях — классический пример: soft-attention для машинного перевода (Bahdanau et al., 2014). Механизм позволил сети «фокусироваться» на релевантных частях входной последовательности при генерации каждого выходного токена. (arXiv)

Self-attention и трансформер. Прорыв — архитектура Transformer (Vaswani et al., 2017): полностью основанная на attention сеть, где рекуррентность и/или свёртки заменены операцией self-attention. Формально ключевая операция (упрощённо) — для матриц запросов $Q$, ключей $K$ и значений $V$:

$$ \mathrm{Attention}(Q,K,V)=\mathrm{softmax}!\Big(\frac{QK^\top}{\sqrt{d_k}}\Big)V $$

Multi-head attention параллельно вычисляет несколько таких проекций, что позволяет моделю учитывать разные типы связей между токенами. Transformer дал масштабируемость и параллельность и стал доминантной архитектурой для языка, а затем был адаптирован и к другим доменам. (NeurIPS Papers)

Почему это важно для «внимания» как концепта. В ML-контексте attention — это явная, дифференцируемая схема взвешивания входов/соседей, позволяющая динамически перераспределять вычислительную «внимательность» между элементами последовательности. Это функционально близко к идее routing / biased weight allocation, но реализовано через матричные операции и оптимизацию градиентом. (NeurIPS Papers, arXiv)


6.2. Visual Transformers (ViT) и attention в компьютерном зрении; сравнение с биологией

ViT и наследие. Vision Transformer (ViT, Dosovitskiy et al., 2020) разбивает изображение на несвязанные патчи (например, 16×16), линейно кодирует патчи в токены и подаёт последовательность токенов в Transformer — без явной свёртки. ViT показал: при большом объёме данных и вычислений трансформеры могут соперничать и превосходить лучшие CNN-архитектуры. (arXiv)

Индуктивные биас-модификации (Swin, др.). Прямой перенос из языка в зрение выявил проблему — ViT слабее в малых данных и плохо захватывает локальную структуру. Для этого появились архитектуры с локальной индукцией: Swin Transformer вводит «shifted windows» (локальные окна внимания с перекрытием), создавая иерархический, локально-свёрточный полиго́н для обмена информации между окнами — это помогает смоделировать многомасштабную структуру изображения и снижает вычислительную сложность. Такие решения приближают трансформерную архитектуру к свойствам биологической зрительной системы (локальная коннективность, иерархия представлений). (arXiv, CVF Open Access)

Сравнение с биологией. Есть несколько уровней сравнения:

  • Локальность и иерархия. Биологический зрительный тракт обладает сильной локальной индукцией (RFs) и иерархией V1→V4→IT; Swin и гибридные ViT/Conv-модели вводят аналогичную локально-иерархическую структуру. (arXiv)
  • Маршрутизация и глобальный контекст. Self-attention обеспечивает прямой (квадратичный) доступ любого токена к любому другому, что функционально похоже на способность корковых систем менять межрегиональные веса (routing). Однако мозг ограничен энергией и латентностью и использует рекуррентность, осцилляции и таламо-кортикальные петли для динамической маршрутизации — свойства, обычно отсутствующие в стандартных трансформерах. Сравнительные исследования показывают, что LLM/transformer-представления частично коррелируют с активностью мозга (особенно в языке), но прямая «биологическая реалистичность» архитектуры остаётся ограниченной. (PNAS, Nature)

6.3. Efficient / approximate attention: sparse, linear, locality-sensitive; cross-attention и multi-head — варианты и эмпирика

Полномасштабное self-attention имеет $O(N^2)$ временную и память-сложность (по длине последовательности $N$), что делает его дорогим для длинных входов (длинные тексты, high-res изображения, видео). Поэтому появилось множество эффективных аппроксимаций и модификаций:

(a) Разреженные шаблоны внимания (sparse patterns). Longformer, BigBird и др. комбинируют локальное (скользящее окно) и глобальное внимание (глобальные токены или случайные пропуски), обеспечивая практическую способность обрабатывать гораздо более длинные последовательности при близкой к линейной сложности. BigBird доказал теоретическую выразительную силу sparse-attention и хорошую практическую производительность на длинных контекстах. (NeurIPS Papers)

(b) Низкоранговые аппроксимации (low-rank). Linformer предполагает, что матрица внимания имеет низкий ранг и аппроксимирует ключи/значения проекциями меньшей размерности, сокращая сложность до $O(N)$ без полного возложения предположений о локальности. (arXiv)

(c) Kernel / random-feature методы. Performer использует рандомизированные feature-map аппроксимации (FAVOR+) для оценки softmax-ядра и достигает линейной сложности с теоретическими гарантиями по аппроксимации. Это популярный приём для масштабирования attention без жёстких предположений о структуре. (arXiv)

(d) Кластеризация / routing. Routing Transformer группирует похожие запросы/ключи (k-means / hashing) и выполняет attention внутри кластеров — эффективный компромисс между глобальной и локальной структурой. Такие методы напоминают идею «маршрутизации» (routing) — направлять токены к релевантным обработчикам. (ACL Anthology)

(e) Оптимизации реализации (IO-aware). FlashAttention и FlashAttention-2 улучшают реальную пропускную способность за счёт оптимизации доступа к памяти и блочной реализации точного attention, что даёт существенные ускорения на GPU без изменения алгоритмики. (arXiv, GitHub)

Практическая эмпирика и выбор. Выбор метода зависит от требований задачи: для геномики/длинных документов и видео — sparse / routing / low-rank; для требований к точности в ограниченной памяти — FlashAttention; для масштабируемости с теоретической гарантийностью — Performer; Swin-подобные решения — для визуальных задач с локальными паттернами. Все эти подходы активно развиваются и комбинируются. (NeurIPS Papers, arXiv)


6.4. Интерпретируемость внимания: attention-map как «объяснение» — механизм vs эвристика

Дебаты. В ML-сообществе есть заметный спор: можно ли считать attention-веса «объяснением» модели? Jain & Wallace (2019) продемонстрировали, что attention-веса не всегда коррелируют с другими мерами важности признаков и что можно подобрать альтернативные attention-распределения, не ухудшающие предсказание — что ставит под сомнение прямую интерпретируемость attention-maps. Wiegreffe & Pinter (2019) критиковали методы и формулировку этих тестов, показав, что при других критериях attention всё же может быть информативным. (ACL Anthology)

Более мощные методы атрибуции. Начиная с 2020–2021 гг., появились методы, которые прокладывают объясняющие значения через слои Transformer (LRP-подобные методы, Chefer et al., 2021), комбинирующие градиентные и распространительные техники, дающие более согласованную и локально согласованную релевантность, чем простая визуализация attention-матрицы. Эти методы показывают, что «внимание» — полезный инструмент для анализа, но простое внимание-heatmap часто даёт неполную и иногда вводящую в заблуждение картину. (arXiv, CVF Open Access)

Вывод для нейронауки. При сопоставлении attention-карт и нейрофизиологических данных нужно быть осторожным: attention-веса обеспечивают одну проекцию поведения модели (внутренние коэффициенты взвешивания), но не эквивалентны causal-влиянию. Для сопоставления с нейронной активностью полезны комбинированные подходы: (i) атрибуция, (ii) вмешательства (перестановка/маскирование токенов), (iii) сравнение латентных представлений (RSA, encoding/decoding). (ACL Anthology, CVF Open Access)


6.5. Attention в задачах рабочей памяти, управления и RL (attention as routing)

Memory & routing (NTM, DNC). Идея использования attention для адресации памяти появилась в работах Neural Turing Machines и Differentiable Neural Computers (Graves et al.): модель учится читать/писать в внешнюю память с помощью soft-attention по адресам — это прямой пример attention как механизма маршрутизации/доступа к ресурсам. Эти архитектуры моделируют аспекты рабочей памяти и алгоритмической манипуляции данными. (arXiv, Nature)

Perceiver, latent bottlenecks и cross-attention. Perceiver (Jaegle et al.) использует асимметричный механизм: cross-attention сжимает большой вход в фиксированный «latent» набор, далее применяется self-attention в латентном пространстве. Это показывает, как attention служит механизмом сжатия и маршрутизации информации, особенно для мультимодальных входов (видео, аудио, изображение), экономя вычисления и обеспечивая гибкий доступ к глобальному контексту. (arXiv)

Transformers в RL — Decision Transformer и др. Недавняя линия исследований трактует RL как задачу sequence modeling: Decision Transformer прогнозирует действия, подав в трансформер последовательности состояний, действий и целевого return, тем самым использовав Transformer как генератор последовательных решений. Это показывает практическую применимость attention-архитектур для планирования/управления и иллюстрирует идею attention как «динамического маршрутизатора» контекстно-зависимых действий. (arXiv)

Routing и modularity. Архитектуры с routing (Routing Transformer, Mixture-of-Experts и др.) направляют токены к специализированным подмодулям, что функционально напоминает в мозге разделение труда между специализированными областями и динамическую маршрутизацию по задаче/сценарию. Эти методы дают практическую реализацию attention-as-routing в больших моделях. (ACL Anthology)


Итоги, ограничения и перспективы взаимодействия с нейронаукой

Краткий конспект.

  • В ML attention — надёжный, формализованный инструмент маршрутизации/взвешивания информации; его реализация (Q/K/V, softmax, multi-head) — это мощный математический шаблон, который дал трансформерам широкую универсальность. (NeurIPS Papers, arXiv)
  • Для науки о мозге attention-механизмы трансформеров дают полезные формализмы (взвешивание, routing, latent bottleneck), но архитектурные и биофизические расхождения (энергия, латентные временные шкалы, нейромодуляторы, рекуррентность, фазовая организация) важны и должны учитываться при интерпретации. Исследования показывают частичную корреляцию представлений трансформеров и мозговой активности (особенно в языке), но это не доказывает эквивалентность механизмов. (PNAS, Nature)

Открытые вопросы и предложения для нейронауки:

  1. Какие элементы attention-архитектур (multi-head, positional encoding, cross-attention) имеют явные физиологические аналоги (gain, phase-coding, пулвинарный routing)? (см. разделы 2–5). (NeurIPS Papers, arXiv)
  2. Как верифицировать, что attention-веса трансформеров соответствуют causal-влиянию на выход: нужны эксперименты с интервенциями (перемешивание токенов, «ablations») и параллельные нейрофизиологические манипуляции. (ACL Anthology, CVF Open Access)
  3. Могут ли энерго- и latency-ограничения мозга вдохновить новые, более biologically-plausible attention-варианты (локальность, рекуррентность, фазовые gating-механизмы)? (см. Swin, Perceiver, Routing). (arXiv, ACL Anthology)

Источники

  • Bahdanau D., Cho K., Bengio Y. (2014). Neural Machine Translation by Jointly Learning to Align and Translate (soft attention). arXiv. (arXiv)
  • Vaswani A., et al. (2017). Attention Is All You Need. NeurIPS / arXiv. (NeurIPS Papers)
  • Dosovitskiy A., et al. (2020). An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (ViT). arXiv. (arXiv)
  • Liu Z., et al. (2021). Swin Transformer: Hierarchical Vision Transformer using Shifted Windows. (ICCV / arXiv). (arXiv)
  • Choromanski K., et al. (2020/2021). Performers: Rethinking Attention with FAVOR+ (linear attention). arXiv / OpenReview. (arXiv)
  • Zaheer M., et al. (2020). BigBird: Transformers for Longer Sequences (sparse attention). arXiv / NeurIPS. (NeurIPS Papers)
  • Wang S., et al. (2020). Linformer: Self-Attention with Linear Complexity. arXiv. (arXiv)
  • Dao T., et al. (2022). FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness. arXiv. (arXiv)
  • Roy A., et al. (2021). Routing Transformer. TACL / arXiv. (ACL Anthology)
  • Jaegle A., et al. (2021). Perceiver: General Perception with Iterative Attention. arXiv. (arXiv)
  • Graves A., Wayne G., Danihelka I. (2014) Neural Turing Machines; Graves et al. (2016) Differentiable Neural Computer. (arXiv, Nature)
  • Chen L., et al. (2021). Decision Transformer: Reinforcement Learning via Sequence Modeling. arXiv. (arXiv)
  • Jain S., Wallace B. C. (2019). Attention is not Explanation. ACL. — критическое исследование интерпретируемости attention. (ACL Anthology)
  • Chefer H., Gur S., Wolf L. (2021). Transformer Interpretability Beyond Attention Visualization. CVPR. — методика релевантности для трансформеров. (CVF Open Access)

7. Синергия нейронауки и ML: взаимные уроки

7.1. Что ML-attention заимствует у биологии (паттерны усиления, локальные ограничения)

Ключевой стимул для появления attention-механизмов в ML — необходимость динамически перераспределять вычислительную «внимательность» по входу. Концептуально это совпадает с биологической идеей усиления релевантных каналов и подавления отвлечений (gain, biased competition, normalization). Современные обзоры по «brain-inspired AI» прямо отмечают, что многие архитектурные решения (взвешивание входов, локальные окна, иерархические блоки) повторяют интуиции из нейронауки: локальная обработка + селективный глобальный контекст. (arXiv, Nature)

Практические примеры:

  • soft/self-attention — формализация «взвешивания» входов, близкая по функции к gain-модуляции в коре; multi-head attention частично имитирует параллельность каналов фичевой селекции. (PMC)
  • локальные трансформеры (Swin-style windows) и гибриды ViT+CNN вводят индуктивные биасы, схожие с локальностью рецептивных полей в зрительном тракте. Это повышает сходимость на малых данных и отражает «локальные ограничения» биологической сети. (Nature)

Нагрузка на доказательства (важные утверждения): что attention в ML концептуально и частично функционально заимствует идеи усиления и локальности из нейронауки — подтверждается обзором по brain-inspired AI и работами, показывающими сходство представлений трансформеров и корковых активностей. (arXiv, Nature)


7.2. Как биология может вдохновить новые архитектуры (локальная когерентность, фазовая кросс-модуляция, биофизические ограничения)

Биология даёт набор конкретных механизмов, которые ML пока отражает лишь частично — и которые могут служить источником новых архитектур и операционных приёмов.

  1. Фазовая маршрутизация и кросс-частотная модуляция. Мозг использует фазовую организацию осцилляций и cross-frequency coupling для временного упорядочения передачи (CTC, фазовое gating). В архитектуре это можно интерпретировать как временные «окна» активации для конкретных каналов/голов внимания — идея уже обсуждается в literature как способ улучшить энергоэффективность и состыковать локальную обработку с глобальным routing. Эксперименты и обзоры по CFC подчёркивают её роль в контроле внимания. (PMC)

  2. Энерго- и latency-ограничения → event-driven и спайковые сети. Биологическая нейронная обработка энергоэффективна и event-driven; neuromorphic / spiking frameworks предлагают архитектурную альтернативу классическим dense-matrix attention, позволяя имплементировать attention как sparse, временно-локализованный gating (neuromorphic reviews / roadmaps). Это особенно перспективно для встраиваемых и real-time систем. (Nature, ScienceDirect)

  3. Подкорковая маршрутизация (таламус / pulvinar) → специализированные маршрутизаторы. Идея «латальных узлов», которые динамически согласуют кортикальные потоки, может вдохновить модульные архитектуры с выделенными routing-модулями (динамический контролер маршрутов или «pulvinar head»), что уже реализуется частично в routing/mixture-of-experts схемах. (PubMed, arXiv)

Практическое следствие: разработать гибридные архитектуры, которые комбинируют (i) локальные иерархические слои, (ii) фазово-синхронное gating для временной маршрутизации, (iii) event-driven sparse attention в спайковом/neuromorphic исполнении — и протестировать их на задачах, где биологические ограничения важны (долгие контексты при ограниченном энергопотреблении). (PMC, Nature)


7.3. Обратное влияние: использование трансформеров и attention-механизмов для анализа нейронных данных

Transformer-парадигмы быстро вошли в инструментарий нейронауки как мощные «универсальные» энкодеры/декодеры нейронной активности и поведения:

  • Neural Data Transformer (NDT/ NDT2) и родственные работы демонстрируют, что трансформерные предобученные представления хорошо подходят для декодирования spiking / calcium сигналов и для многоконтекстного предобучения. (PMC)
  • Исследования показывают, что некоторые внутренние представления трансформеров коррелируют с человеческими и животными мозговыми реакциями при обработке естественных стимулов (language, vision), что даёт практическую платформу для гипотез-генерации и сравнения представлений. (Nature)

Методологические преимущества: трансформеры удобны для (i) masked-prediction предобучения (self-supervision) на нейроданных, (ii) attention-maps как инструментов гипотез (с оговорками по интерпретируемости), (iii) генерации контрастных представлений для RSA/encoding-models. (PMC, ScienceDirect)


7.4. Критические замечания: где аналогия ломается

Несколько ключевых ограничений и зон осторожности:

  1. Attention-веса ≠ causality / importance. В ML-моделях attention-матрицы не всегда отражают причинную важность входов для вывода (см. классическую критику и ответную дискуссию в NLP). Следовательно, прямые параллели «голова внимания ↔ нейронный источник влияния» некорректны без вмешательств и адекватной валидации. (ACL Anthology)

  2. Временные и биофизические различия. Трансформеры обычно оперируют статическими матрицами и батчевой параллельностью; мозг — рекуррентен, асинхронен, фазово-организован и ограничен энергией/латентностью. Это делает прямую биологизацию стандартного attention проблематичной — потребуется рекуррентность, event-driven режимы и временное кодирование. (arXiv, Nature)

  3. Экспериментальные соответствия частичные. Наблюдаемая корреляция между представлениями трансформеров и мозгом сильна в некоторых областях (язык, высокоуровневое зрение), но она не доказывает механистическую эквивалентность — модели могут достигать похожих функциональных результатов разными средствами. Требуются интервенционные эксперименты и контроль задач, чтобы различать «функциональную аппроксимацию» и «реальную реализацию». (Nature)


7.5. Рекомендации для конкретных исследований (практические шаги)

  1. Генерация гипотез «голова↔ритм»: сравнить динамику attention-голов в трансформере, обученном на нейроданных, с фазовой активностью (CFC) в соответствующих мозговых областях; провести вмешательства (маскирование токенов / временные сдвиги) и проверить предсказанную перестройку активности. (PMC)

  2. Биофизически-ограниченные трансформеры: реализовать event-driven / spiking-based attention (sparse gating + phase windows) и сравнить энергоэффективность и производительность с классическими моделями на биологически релевантных задачах. (Nature, ScienceDirect)

  3. Encoding/decoding с трансформерами + causal tests: использовать трансформеры как encoding-models для нейроданных, затем проводить целевые вмешательства (TMS/optogenetics / pharmacology) чтобы проверить causally предсказанные изменения представлений и attention-maps. (PMC, PubMed)


Краткое заключение

Синергия между нейронаукой и ML даёт реальную выигрышную стратегию: ML-attention обеспечивает чёткую формализацию и инструменты масштабного обучения, а биология — набор механизмов (фазовая маршрутизация, нейромодуляция, энергосбережение), которые могут обогатить архитектуры и сделать их более робастными и энергоэффективными. Однако переход «от совместимости представлений» к «реальной механистической эквивалентности» требует смешанных методологий — предсказаний моделей, нейрофизиологической записи и причинных интервенций. (arXiv, PMC)


8. Методы измерения и анализ

8.1. Единичные нейронные записи, LFP, EEG/MEG, fMRI — что каждый метод даёт про внимание

Единичные нейронные записи (single-unit / multi-unit).

  • Что измеряет: спайковые события отдельных нейронов (высокая временная точность, миллисекунды) и — при multi-unit — локальные ансамбли. Позволяет оценивать firing-rate, вариабельность, корреляции «шум-к шуму», точечные causal-интервенции (электрическая стимуляция, оптогенетика).
  • Что даёт по вниманию: прямые подтверждения gain-модуляции, feature-/object-selectivity, изменение корреляций при переключении внимания; возможность тестировать причинность при вмешательствах. Для масштабных популяционных вопросов сейчас часто применяют Neuropixels-пробы (тысячи каналов, стабильные хронические записи). (Журналы физиологии)

Local Field Potential (LFP).

  • Что измеряет: суммарные синаптические / постсинаптические токи в локальном объёме (частотные полосы: дельта/тета/альфа/бета/гамма).
  • Что даёт по вниманию: частотная модуляция (усиление гаммы, альфа-подавление и т.д.), фазовая организация спайков относительно LFP, инструменты для изучения межрегиональной координации (когерентность, CFC). LFP служит мостом между single-unit и масштабными методами (EEG/MEG/fMRI). (eLife)

EEG / MEG.

  • Что измеряет: суммарные постсинаптические потенциалы (EEG) и магнитные поля (MEG) от больших популяций; высокая временная точность (мс), но ограниченная пространственная локализация (особенно для EEG); MEG даёт лучшую пространственную локализацию для корковых источников.
  • Что даёт по вниманию: временная динамика процессов (ERP компоненты, фазовая синхронизация, частотные маркеры внимания), мониторинг быстрого переключения и реакций на cue/target; хороши для мультиплейс-task и для BCI/real-time приложений. (PMC)

fMRI (BOLD).

  • Что измеряет: гемодинамический отклик (секунды) как прокси локальной нейронной активности; высокая пространственная разрешающая способность (миллиметры), низкая временная (секунды).
  • Что даёт по вниманию: картирование корковых/субкортикальных сетей внимания (DAN/VAN, pulvinar, BG), градиенты активации, пространственные карты modulated BOLD signals (например, усиление при feature-attention), + возможность связать с поведенческими эффектами и индивидуальными различиями. Ограничение: BOLD — индиректный и медленный сигнал; интерпретация нейронной причины требует осторожности и мульти-модальных проверок. (Oxford Academic)

Комбинированные подходы (spikes + LFP + fMRI, simultaneous EEG-fMRI, opto + electrophys и т.д.).

  • Почему важны: комбинирование уровней (миллисекунды → секунды; единичные нейроны → сеть) — единственный путь к связыванию макро- и микрофеноменов внимания (напр., как фазовая синхронизация LFP связана с BOLD-коррелатами). Многие современные исследования используют Neuropixels, широкопольную Ca-иммерсию или совместимые протоколы с оптогенетикой, чтобы устанавливать причинность и масштаб. (PMC)

8.2. Аналитические подходы: Granger, MVAR, coherence, MVPA, RSA (что и когда применять)

Когерентность и спектральные меры (coherence, phase-locking, imaginary coherency).

  • Что делает: оценивает частотную синхронизацию между сигналами (LFP/EEG/MEG), фазовую согласованность и cross-frequency coupling. Для борьбы с артефактами объёмного распространения (volume conduction) применяют меры, нечувствительные к нулевой фазе (imaginary part of coherency, phase-lag index и т.д.). Эти меры широко используются для проверки гипотез CTC и фазовой маршрутизации внимания. (PubMed)

Granger-causality / MVAR (Vector AutoRegressive) методы.

  • Что делает: на основе временных рядов выявляет направленные статистические влияния (если прошлое сигнала X улучшает предсказание сигнала Y — X «гранжер-причинен» Y). Реализуется через MVAR-модели; даёт частотно-разрешённые и временно-разрешённые оценки. Важно: чувствителен к предобработке, задержкам (конволюции BOLD) и несинхронности источников — требует проверки предположений и контроля на общие входы/конфунд. (PMC)

MVPA (Multi-Voxel / Multi-Channel Pattern Analysis) и decoding.

  • Что делает: классификация или регрессия по многомерным паттернам активности (voxels, electrodes, neurons) для извлечения информации о стимуле/состоянии/внимании. MVPA чувствителен к распределённым кодам и в ряде случаев «декодирует» то, что univariate-аналитика не видит. Требует аккуратных схем кросс-валидации и контроля «double-dipping». (PubMed)

RSA (Representational Similarity Analysis).

  • Что делает: сравнивает матрицы расстояний/сходства (RDM) между условиями в разных модальностях (фМР-паттерны, spiking patterns, модельные представления) — позволяет напрямую сравнить представления мозга и моделей. Очень удобен для сопоставления ML-представлений (transformers, CNNs) с нейро-данными. (PMC)

Практические замечания по выбору метода.

  • Для изучения временной маршрутизации внимания: LFP/EEG/MEG + coherence / phase-locking / CFC. (см. Fries). (PubMed)
  • Для направления причинности: MVAR / Granger с контролем lag-effects; в электрофизиологии дополнять интервенциями (стимуляция/оптогенетика). (PMC)
  • Для пространственной картины и карт сети: fMRI + MVPA / RSA для связи с модельными представлениями. (PubMed, PMC)

Ограничения и проверки достоверности.

  • Все меры направленной связи статистические, чувствительны к общим входам, пропущенным переменным и предобработке — всегда проводить контрольные симуляции, permutation-тесты и surrogate-data проверки. Для когерентности использовать методы, нечувствительные к volume conduction (imaginary coherency и т.п.). (PubMed, PMC)

8.3. Новые экспериментальные технологии

Neuropixels (1.0 → 2.0) и масштабные электродные массивы.

  • Суть: высокоплотные CMOS-пробы с тысячами сайтов для одновременной регистрации spiking/LFP в десятках областей. Neuropixels 2.0 позволяет стабильные хронические записи тысяч единичных нейронов в многодневных экспериментах — революция для изучения популяционной динамики внимания в больших сетях. Практический эффект: можно исследовать одновременные изменения firing-rate, корреляций и латентных траекторий в десятках областей при attentional tasks. (PMC)

Widefield и двухфотонная calcium-иммерсия.

  • Суть: оптическая регистрация активности больших полей (widefield — cortex-wide) или отдельных нейронов (2P) с генетически закодированными индикаторами Ca2+/GCamp; даёт хорошее пространственное покрытие (widefield) и клеточный уровень (2P), но с более низкой временной точностью, чем spikes. Ключевая польза: визуализация cortex-wide динамики внимания, картирование потока активности и оценка функциональной парцелляции и её изменений при attention. (PMC, Nature)

Оптогенетика и causal-манипуляции.

  • Суть: генетическое введение светочувствительных молекул (ChR2, Arch и др.) для точного возбуждения/подавления выбранных нейронных популяций. Внимание: opto позволяет тестировать причинность (включите/выключите конкретный узел — смотрите на поведение/нейрофизиологию). Комбинация opto + Neuropixels / widefield даёт мощный causal-контраст. (PMC)

Другие технологии и тренды.

  • miniaturized head-mounted imaging for freely moving animals, genetically targeted indicators (GCaMP variants), all-optical read-write (simultaneous imaging + stimulation), chronic imaging + chronic electrophys для longitudinal studies. Эти инструменты делают возможными изучение внимания в естественных и «походных» условиях и в обучении/пластичности. (Nature, PMC)

8.4. Статистические и репликационные проблемы; требования к дизайну эксперимента

Крупные проблемы (эмпирически подтверждённые).

  • Низкая статистическая мощность / small-n: классическая критика — «Power failure»: малые выборки подрывают воспроизводимость и приводят к переоценённым эффектам. Планирование исследования должен начинаться с power-analysis и realistic effect-sizes. (Nature)
  • Множественная проверка и ложноположительные результаты (fMRI cluster-extent issues): Eklund et al. показали, что классические parametric cluster-tests могут иметь завышенные FWE-ошибки; поэтому рекомендуются непараметрические permutation-методы / TFCE / строгие контролируемые процедуры. (PNAS)
  • Циркулярный анализ («double-dipping»): использование одних и тех же данных для выбора ROI / наборов признаков и для тестирования даёт искажения; решение — независимый набор для селекции, либо правильное кросс-валидационное деление и повторение отбора на каждом фолде. (PMC)

Практические рекомендации по дизайну (конкретно для исследований внимания).

  1. Power & trials: планируйте количество субъектов / сессий / триалов исходя из power-analysis на ожидаемый размер эффекта (учитывайте меж-субъектную вариабельность и корреляции внутри субъекта). Для single-unit / population studies компенсируйте variability большим числом сессий и животных/испытаний; для fMRI учитывайте большие между-субъектные разбросы. (см. Button; Poldrack по reproducibility). (Nature, evullab.org)
  2. Контроль физиологии: контроль за движением глаз (eye-tracking), арousal (pupilometry), дыханием/сердцем в fMRI/EEG — обязательный минимум (внимание тесно связано с арousal/metabolic confounds). (PMC)
  3. Cross-validation & independence: при MVPA / decoding — правильно разделять данные на train/test, повторять селекцию признаков внутри каждого фолда, либо использовать независимые сессии/подвыборки для отбора ROIs. Не делайте селекцию и тест на одних и тех же данных без корректировки. (PubMed, PMC)
  4. Permutation / nonparametric inference: особенно для fMRI/MEG/EEG пространственных карт и множественных тестов — применяйте permutation-inference, TFCE или контролируемые corrections; не полагайтесь без критики на устаревшие parametric cluster-extent thresholding. (PNAS, fil.ion.ucl.ac.uk)
  5. Pre-registration & open science: регистрируйте дизайн/предобработку/statistics (pre-register) и публикуйте код/данные в BIDS-совместимом формате; это значительно повышает воспроизводимость и позволяет мета-анализы. (bids.neuroimaging.io, arXiv)

Рекомендованный рабочий pipeline (пример):

  • design → simulate power/effects → collect behavioural + physiological controls (eye, pupil) → preprocess (artifact removal, motion correction, source localization для MEG/EEG) → feature selection (within-fold) → decoding / MVPA / RSA → permutation / bootstrap inference → report effect sizes + CIs + negative results → share data/code (BIDS, GitHub). (PubMed, PMC, bids.neuroimaging.io)

Источники

  • Steinmetz N. A., et al. (2021). Neuropixels 2.0: A miniaturized high-density probe for stable, long-term brain recordings. Science. (PMC)
  • Deisseroth K. (2010). Optogenetics. Nat. Methods / PMC review. (PMC)
  • Gallego-Carracedo C., et al. (2022). Local field potentials reflect cortical population dynamics. eLife (review/empirical link LFP ↔ population). (eLife)
  • Fries P. (2015). Rhythms for cognition: Communication through coherence. Trends Cogn Sci. — phase/coherence and attention. (PubMed)
  • Seth A. K., Barrett A. B., Barnett L. (2015). Granger causality analysis in neuroscience and neuroimaging. J. Neurosci. — overview G-causality methods and caveats. (PMC)
  • Norman K. A., et al. (2006). Beyond mind-reading: multi-voxel pattern analysis of fMRI data. Trends Cogn Sci. — MVPA review. (PubMed)
  • Kriegeskorte N., Mur M., Bandettini P. (2008). Representational Similarity Analysis (RSA). Front Syst Neurosci. — RSA framework. (PMC)
  • Kriegeskorte N., et al. (2009). Circular analysis in systems neuroscience: the dangers of double-dipping. Nat Neurosci. — caution on non-independent analyses. (PMC)
  • Button K. S., et al. (2013). Power failure: why small sample size undermines the reliability of neuroscience. Nat Rev Neurosci. — power/reproducibility. (Nature)
  • Eklund A., Nichols T. E., Knutsson H. (2016). Cluster failure: why fMRI inferences for spatial extent have inflated false-positive rates. PNAS. — multiple comparisons caution and permutation recommendations. (PNAS)
  • Poldrack R. A., et al. (2017). Scanning the horizon: towards transparent and reproducible neuroimaging research. Nat Rev Neurosci / best practices. (evullab.org)

Короткое резюме и практические чек-лист-рекомендации

  1. Метод выбирайте под вопрос: millisecond-mechanisms → spikes/LFP/EEG/MEG; spatial-network mapping → fMRI; representational comparisons → MVPA/RSA. (PMC, eLife, PubMed)
  2. Комбинация методов — стандарт качества для связки причинных и корреляционных выводов (opto + Neuropixels; spikes + LFP + widefield / fMRI). (PMC)
  3. Статистика и дизайн: планирование по power, разделение данных для селекции/теста, permutation-инференция, preregistration, BIDS/coded pipelines — обязательны для надёжных выводов. (Nature, PMC, bids.neuroimaging.io)

9. Внимание в развитии, патологии и индивидуальных различиях

Вводная нота

Внимание — системная функция, динамически меняющаяся на протяжении жизни. Нарушения внимания встречаются как специфические клинические состояния (ADHD, геминеgлект), так и в составе более широких нейропсихиатрических/нейродегенеративных синдромов (шизофрения, деменции). Одновременно индивидуальные различия (генетика, развитие, опыт, мотивация, арousal) определяют вариабельность нормальной функции внимания и отклонений. (PMC)


9.1. Развитие внимательных систем (онтогенез)

Ключевые факты и временная линия

  • Раннее детство (0–3 года). Первичные формы распределения внимания (рефлексивное, ориентировочное) формируются очень рано, зависят от развития стволовых и подкорковых систем арousal и всплесков сенсорного опыта. (PMC)
  • Дошкольный и ранний школьный возраст. Быстрый рост исполнительного контроля внимания: способность удерживать внимание, переключаться и подавлять отвлечения улучшаются заметно в возрасте 3–8 лет по мере созревания лобно-париетальных сетей. ERP-марки (P300) и поведенческие индексы демонстрируют прогрессирующее сокращение латентности и увеличение эффективности отбора стимулов. (PMC)
  • Подростковый период и молодость. Дальнейшая дифференциация и интеграция сетей внимания: продолжают формироваться фронтальные контрольные узлы и длинные беломозговые тракты, что улучшает устойчивую и контрольную составляющую внимания; одновременно увеличивается роль нейромодуляторных систем (дофамин). (PMC)
  • Взросление и старение. Старение связано с уменьшением некоторой устойчивой/исполнительной компоненты внимания, ослаблением скорости обработки и изменениями в нейромодуляторных системах (например, холинергическая деградация в старшем возрасте). Эти изменения частично компенсируются опытом и стратегиями. (PMC, Научный журнал)

Методы и доказательная база Рост знаний опирается на продольные и поперечные исследования, ERPs (P300, MMN), фМРI-карты развития сети (лобно-париетальные соединения) и оптические методы в животных моделях. Современные обзоры подчёркивают необходимость большего числа продольных когорт с мульти-модальными данными для понимания детерминантов траекторий развития. (PMC)


9.2. Нарушения внимания: нейрофизиологические корреляты и терапевтические следствия

ADHD (Attention-Deficit/Hyperactivity Disorder)

Кратко по нейрофизиологии. ADHD — эндогенное нейроразвитийное расстройство, связанное с нарушениями фронто-стриатальных и фронто-париетальных сетей, дисфункцией дофаминовой и норадренергической систем, а также изменениями в активности default-mode network (DMN) и в показателях EEG (повышенный theta/beta ratio у части пациентов) и ERP (изменённые P300 показатели). Большие обзоры и мета-анализы подтверждают системные изменения в сети внимания и исполнительном контроле у детей и взрослых с ADHD. (Psychiatry Online, PubMed, PMC)

Клинические следствия и лечение. Стимулянты (метилфенидат, амфетамины) и непромоторные препараты (atomoxetine, guanfacine) остаются основой фармакотерапии — они быстро улучшают клинические симптомы и показатели внимания, хотя мета-аналитические обзоры отмечают ограничения в долгосрочных эффектах на качество жизни и необходимость комбинированного подхода. Недавние крупные обзоры 2023–2024 суммируют генетику, эпи- и средовые факторы и указывают на сложность долгосрочных исходов. (PubMed, PMC, The Sun)

Нейростимуляция / цифровые вмешательства. Небольшие и средние RCT показывают обещание для TMS/tDCS и цифровых (целевых) тренингов, но результаты гетерогенны; мета-аналитические итоги по TMS (2025) указывают на статистически значимое улучшение симптоматики ADHD в ряде исследований, однако требуется стандартизация протоколов и долгосрочные данные. Также появляются данные о полезности цифровых когнитивных программ как адъювантной терапии. (PMC, Научный журнал)


Геминеглект (hemispatial/unilateral spatial neglect)

Нейроанатомия и механизмы. Геминеглект — мультикомпонентный синдром, чаще после правополушарного поражения (темпоро-париетальная зона, IPL/TPJ, глубокие беломозговые тракты) с вовлечением как корковых, так и субкортикальных структур и их связей. Литература подчёркивает гетерогенность локусов поражения и субтипов neglect (perceptual vs motoric; egocentric vs allocentric), что усложняет унифицированное объяснение. (demeyerelab.org, Научный журнал)

Реабилитация. Prism adaptation (PAT) — наиболее исследованный метод восстановления (краткие программы с заметными функциональными улучшениями у подгрупп пациентов), но недавние мета-обзоры и критические рецензии отмечают вариабельность эффектов и необходимость «dose-finding» исследований и стандартизации протоколов. Другие подходы (visual scanning training, vestibular stimulation, TMS/GVS, тренировка моторики) показывают смешанные результаты; комбинированные мультидисциплинарные программы дают лучшие функциональные исходы. (PMC, Frontiers)


Шизофрения

Нарушения внимания и нейрофизиология. В шизофрении часто отмечаются выраженные дефициты внимательной обработки: снижение показателей P300 и mismatch negativity (MMN), нарушения рабочей памяти, аномалии в fronto-parietal networks и нарушенная синхронизация осцилляций (чаще в гамма/тета диапазонах). Современные нейровизуализационные обзоры демонстрируют системные отклонения связности и усиление шума/дискоординации сетей внимания. Эти изменения объясняют многие когнитивные симптомы и прогнозируются как маркеры ранней фазы болезни. (PMC, PubMed)

Клиническое значение. Дефициты внимания коррелируют с функциональным исходом и качеством жизни; терапевтические подходы включают фармакотерапию (антипсихотики), когнитивные тренировки, а также исследуются neuromodulation-подходы (TMS) и таргетированные интервенции, направленные на восстановление синхронности и сетевой интеграции. (PMC)


Деменция (включая болезнь Альцгеймера)

Роль внимания и нейромодуляторов. Нарушения внимания — ранний и частый компонент при нейродегенерации (особенно у Альцгеймера и смешанных деменций). Деградация холинергической системы (базальный передний мозг) тесно связана с ухудшением внимания и памяти; это клинически легитимировало применение ингибиторов ацетилхолинэстеразы (AChEIs), которые дают умеренное улучшение когнитивных функций, включая аспекты внимания. Обновлённые обзоры по роли холинергии в AD и терапии подтверждают биологическую логику и ограниченную клиническую эффективность. (Oxford Academic, PMC)

Кросс-заболевательные связи. Недавние эпидемиологические данные и анализы полигенетического риска указывают на возможную связь между ранним ADHD и повышенным риском деменции в позднем возрасте, но механизмы и причинность остаются предметом исследований и обсуждения. Это подчёркивает необходимость прослеживания жизненных траекторий у пациентов с нарушениями внимания. (PMC)


9.3. Влияние обучения, тренировки и нейромодуляции (TMS, tDCS, фармакология)

Тренировка внимания и когнитивные интервенции

  • Целенаправленные тренинги и компьютерные программы. Рандомизированные исследования и мета-анализы показывают, что цифровые и структурированные когнитивные тренировки (task-specific, adaptive) могут улучшать показатели внимания в краткосрочной перспективе у детей и взрослых, особенно при сочетании с фармакологией или сопровождением. Однако переносы на «реальную жизнь» и стойкость эффектов варьируются; критическая масса доказательств на 2024–2025 гг. становится убедительнее, но требует стандартизации программ и длительных follow-up. (Научный журнал, PMC)

  • Учебные программы и школьные интервенции. Широкомасштабные программы, ориентированные на улучшение саморегуляции и внимания у детей, дают умеренные и клинически релевантные выгоды, особенно при раннем вмешательстве. (PMC)

Фармакологические подходы

  • ADHD: Стимулянты и немоторные препараты демонстрируют устойчивое улучшение симптомов внимания в кратко- и среднесрочной перспективе; долгосрочные эффекты на качество жизни менее однозначны и требуют мультидисциплинарного управления (медикаменты + психотерапия + педагогическая/социальная поддержка). (PubMed, PMC)

  • Деменция/AD: Ингибиторы холинэстеразы и мемантин дают умеренные когнитивные эффекты; они частично улучшают функции внимания за счёт усиления холинергической передачи, но не останавливают болезнь. Новые стратегии нацелены на мультифакторное вмешательство (биомаркеры, ранняя диагностика, комбинированные терапии). (Oxford Academic, PMC)

Нейростимуляция (TMS, tDCS) и другие физические вмешательства

  • TMS. За последние годы накопились данные о том, что таргетная TMS (высокочастотная стимуляция PFC или других контрольных узлов) может улучшать аспекты внимания у пациентов с ADHD и у некоторых когнитивно-импейрдированных групп; недавний систематический обзор/мета-анализ 2025 указывает на статистически значимый эффект, но подчёркивает необходимость стандартизации протоколов и длительных исследований. (PMC)

  • tDCS. Данные по tDCS смешанные: некоторые рандомизированные исследования показывают усиление эффектов тренинга внимания при сочетании с tDCS, другие — отсутствие эффекта. Heterogeneity по позиционированию электродов, параметры стимуляции и индивидуальная восприимчивость ограничивают консенсус. (Научный журнал)

  • Другие вспомогательные методы. Galvanic vestibular stimulation, prism adaptation (для neglect), нейрофидбек и multi-modal реабилитация показывают перспективы, но часто требуют более мощных RCT и стандартизации процедур. (PMC, Frontiers)


Индивидуальные различия и факторы риска

  • Генетика и полигенный риск. Полигенные рисковые профили (PRS) вносят вклад в восприимчивость к ADHD и, возможно, к связным когнитивным исходам; текущие исследования 2024–2025 пытаются декомпозировать, как PRS взаимодействует со средовой нагрузкой и образованием в предсказании исходов внимания в поздней жизни. (PMC)

  • Arousal, сон и физиология. Сон, уровень арousal (pupilometry, LC-NE activity), хронический стресс и состояние здоровья (метаболические факторы, сосудистые риски) модифицируют функцию внимания и влияют на эффективность интервенций. (PMC)

  • Социальные и образовательные факторы. Социально-экономический статус, качество раннего обучения и стимуляции влияют на развитие контрольных функций и долгосрочные траектории внимания. (PMC)


Практические выводы и рекомендации (для исследователей и клицистов)

  1. Комплексный/мультидисциплинарный подход. Диагностика и лечение нарушений внимания должны сочетать нейропсихологию, поведенческие вмешательства, фармакотерапию и при уместности — нейростимуляцию. (PubMed, PMC)
  2. Ранняя диагностика и вмешательство. Для детских популяций ранняя идентификация дефицитов внимания и раннее вмешательство дают наилучшие долгосрочные результаты. (PMC)
  3. Стандартизация и долгосрочный follow-up. Для TMS/tDCS, prism adaptation и цифрового тренинга нужны крупные, стандартизованные RCT с длительными наблюдениями и функциональными исходами. (Frontiers, PMC)
  4. Персонализация терапии. Учитывайте индивидуальные биомаркеры (EEG-маркеры, PRS), коморбидности и образ жизни при выборе вмешательств; комбинированные стратегии обычно эффективнее. (PubMed, PMC)

Источники

  • Karakaş S. (2024). A Review of Childhood Developmental Changes in Attention. (обзор онтогенеза внимания). (PMC)
  • Shen F., et al. (2024). Advances in the etiology and neuroimaging of children with ADHD. (review). (PMC)
  • Large meta-analysis: A Meta-Analysis of 243 Task-Based fMRI Studies — ADHD (2024). (Psychiatry Online)
  • Groom MJ. (2022). Current Pharmacological Treatments for ADHD — обзор терапии. (PubMed)
  • Prism adaptation and spatial neglect reviews (Goedert 2015; Chen 2025). (PMC, Frontiers)
  • Fries P., et al.; MMN/P300 literature and schizophrenia reviews (2023–2024). (PMC)
  • Alzheimer's / dementia reports and cholinergic reviews (Hampel 2018; 2024–2025 cholinergic reviews). (PMC, Oxford Academic)
  • Systematic review/meta-analysis of TMS for attention (2025). (PMC)

Заключение раздела

  • Развитие и патологии внимания охватывают широкий спектр механизмов — от нейромодуляции и сетевой организации до генетики и среды; понимание требует продольных, мульти-модальных исследований. (PMC)
  • Клинические вмешательства (медикаменты, тренинги, neuromodulation) дают реальные выгоды, но их эффективность зависит от стандартизации протоколов, персонализации и долгосрочных данных. (PubMed, PMC)
  • Перспективы исследования: интегрировать раннюю диагностику, PRS и биомаркеры (EEG/fMRI), тестировать комбинированные вмешательства в проспективных когортах и уточнять механистические модели, связывающие нейроанатомию, физиологию и поведение. (PMC)

10. Attention vs. Consciousness / рабочая память

Ниже — развёрнутый, междисциплинарный разбор отношений между вниманием и сознанием, а также ролью внимания в рабочей памяти. Текст опирается только на авторитетные, высокоцитируемые источники (классика + обзоры и эмпирические работы 2000–2021 и новее), — ключевые ссылки приведены в конце каждой смысловой секции.


10.1. Пересечения и различия между вниманием и сознанием — аргументы «за» и «против»

Короткое введение: два понятия и частые путаницы

«Внимание» и «сознание» часто употребляют как синонимы, но в современной литературе их отличают по функциональным целям и механизмам: внимание — преимущественно селективный механизм перераспределения вычислительных ресурсов (routing, усиление, фильтрация), сознание (awareness) — субъективное переживание и глобальная доступность информации для отчёта и контроля. Концептуальная ясность важна: разные формы сознания (phenomenal vs access consciousness) и разные формы внимания (top-down, bottom-up, внутреннее/внешнее) требуют аккуратных определений. (nedblock.us, web.ics.purdue.edu)

Аргументы в пользу различия (dissociation)

  1. Двойная диссоциация в эксперименте. Были показаны случаи, когда внимание присутствует без сознания и наоборот: (a) внимание можно направлять на стимулы, которые остаются незримыми (attended but not seen); (b) люди способны иметь сознательное восприятие «gist» сцены при минимальном фокусированном внимании. Такие поведенческие феномены и соответствующие физиологические данные приводят к выводу, что attention ≠ consciousness. (PubMed, Cell)

  2. Нейрофизиологическая аргументация (рекуррентная обработка vs feedforward). В работах Lamme и соавт. подчёркивается роль рекуррентной, многократной обработки в коре для возникновения сознательного восприятия: feedforward-поток может обеспечивать первичную «обработку» и направлять внимание, но устойчивое сознание требует повторной рекуррентной интеграции. Это нейробиологическое различение поддерживает идею функциональной независимости процессов. (Научный журнал)

  3. Философские и концептуальные аргументы. Н. Блок и другие подчёркивают различие между «phenomenal consciousness» (сырое ощущение) и «access consciousness» (информация, доступная для отчёта и контроля), что дополнительно разъединяет внимание (как механизм доступа/маршрутизации) и феноменальную составляющую. (nedblock.us)

Аргументы в пользу тесной связи / зависимости

  1. Практическая корреляция и функциональная зависимость. Во многих задачах внимание повышает вероятность, что стимул окажется в сознании (attention increases reportability): усиление сигнал/шум, фокусировка ресурсов и улучшение кодирования способствуют доступности для субъекта. Поэтому attention часто необходим (но не всегда достаточен) для сознательного отчёта в типичных условиях. (Cell)

  2. Теоретические интеграции (GNW / predictive GNW). Глобальная нейронная рабочая область (Global Neuronal Workspace, GNW) трактует сознание как «глобальное пробуждение/зажигание» представления, которое делает информацию доступной широкому кругу модулей; внимание в этой схеме может играть роль селекторного механизма, который повышает вероятность инициации глобального зажигания. Современные попытки интегрировать predictive coding и GNW предлагают видеть внимание как модуляцию «precision», которая делает определённую предикционную ошибку достаточно важной для глобального распространения. Таким образом, модели допускают и тесную функциональную связь между attention и conscious access, и возможность их частичного разделения в специфических задачах. (PubMed, Научный журнал)

Практические выводы по спору

  • Не существует единственного ответа «внимание = сознание» или «внимание ≠ сознание». Совокупность данных лучше описывается гибридной картиной: attention и consciousness — частично независимые процессы с сильными функциональными взаимодействиями; в одних задачах и контекстах они диссоциируются, в других — сильно коррелируют и даже являются каскадно взаимозависимыми (attention → повышение вероятности access/awareness). (PubMed, Научный журнал)

Ключевые источники (для этой подсекции): Koch & Tsuchiya (2007) — обзор аргументов за диссоциацию; Lamme (2003) — рекуррентная теория сознания; Pitts et al. (2018) — обзор эмпирических данных о двойной диссоциации; Dehaene / GNW и последующие интеграции predictive GNW. (PubMed, Научный журнал, PMC)


10.2. Роль внимания в рабочей памяти и в формировании субъективного опыта

Внимание как движущая сила рабочей памяти (WM)

Концептуальная картина. Современные теоретические модели рабочей памяти (embedded-processes, Cowan; фреймворки Oberauer) рассматривают WM как «активированную часть» репрезентаций памяти с внутренним фокусом внимания, который выделяет один(или несколько) элементов для непосредственной обработки и действий. В этой картине внимание — механизм, который выбирает, усиливает и удерживает представления в фокусе WM, делая их доступными для манипуляций и отчётов. (memory.psych.missouri.edu, PMC)

Эмпирические данные. Работы Olivers et al. (2011) и последующие показывают, что «attentional templates» в WM направляют восприятие (guiding visual attention) и что разные состояния элементов WM (активный фокус vs. «accessory»/фоновые представления) имеют разные эффекты на поведение. Эксперименты на переключение фокуса WM, а также нейрофизиологические записи демонстрируют изменение нейронной активности и корреляций при смещении внимания внутри WM. (Научный журнал)

Модели и механизмы. Рекуррентные и аттракторные модели объясняют удержание элементов WM как устойчивые состояния, которые attention может «закреплять» посредством топ-даун сигналов и нейромодуляции (например, дофамин/холин). Альтернативные представления различают «активные» и «потенциально активируемые» состояния (active vs latent), где только активные непосредственно влияют на поведение и восприятие. (nedblock.us, PMC)

Внимание, WM и субъективный опыт

От рабочей памяти к субъективности. Поскольку рабочая память делает содержание доступным для отчёта и действия, она тесно связана с так называемой access-consciousness (информация доступна для отчёта). Внимание, действуя на WM, по сути повышает вероятность, что представление станет доступным для субъективного отчёта. Однако феноменальная составляющая (raw субъективное переживание) может, по некоторым авторам, иметь частичную автономию от тех механизмов WM/attention, которые обеспечивают отчёт. (nedblock.us)

Прямые нейрофизиологические свидетельства. Эксперименты, сочетающие EEG/MEG/fMRI с задачами WM и отчетом о сознании, показывают: (i) shift of attention within WM сопровождается характерными ERP/oscillatory маркерами; (ii) активности, коррелирующие с reportability, имеют признаки рекуррентной глобальной распространённости (связанные с GNW-подобной «ignition»). Это сближает роль WM/attention и механизмов доступа к сознанию, но подчёркивает, что не каждая поддерживаемая WM-репрезентация сопровождается полной «феноменальной» отчётностью. (Научный журнал, PubMed)

Практическая и экспериментальная импликация

  1. Дизайн экспериментов. Чтобы различать внимание, WM и сознание, полезны парадигмы с независимой манипуляцией: (a) манипулировать вниманием (cueing) при контроле над reportability; (b) использовать непрямые метрики (implicit measures) вместе с отчётами; (c) сочетать манипуляции нейромодуляторов/оптогенетики для тестирования causality. (Научный журнал, PMC)

  2. Моделирование. Гибридные модели, комбинирующие normalization/gain (для селекции), рекуррентную динамику (для удержания) и GNW-type глобальную интеграцию (для доступа), лучше всего формализуют наблюдаемые феномены и предсказывают, при каких условиях attention приводит к сознательному доступу, а при каких — нет. (Научный журнал)


Краткое сводное заключение

  • Внимание и сознание — взаимосвязанные, но не тождественные процессы: в ряде задач они диссоциируются, в других — тесно переплетены; нейробиологические модели дают инструменты для формальной интеграции этих наблюдений. (PubMed, Научный журнал)
  • Внимание критически вовлечено в рабочую память: оно реализует фокус и управляет тем, какие элементы активны и доступны для отчёта / действия; тем не менее WM содержит и латентные уровни, которые не всегда прямо влияют на восприятие. (PMC, Научный журнал)
  • Научный путь вперёд — комбинированные парадигмы (поведение + EEG/MEG + fMRI + causal interventions) и строгое моделирование (ментально/вычислительно/биофизическое) позволят детальнее описать, когда и как attention вызывает conscious access, а когда — нет. (PubMed, Научный журнал)

Источники

  • Koch C., Tsuchiya N. (2007). Attention and consciousness: two distinct brain processes. Trends Cogn Sci. (PubMed)
  • Lamme V. A. F. (2003). Why visual attention and awareness are different. Trends Cogn Sci. (Научный журнал)
  • Block N. (1995). On a confusion about a function of consciousness. Behav Brain Sci. (nedblock.us)
  • Mashour G. A., et al. (2020). Conscious Processing and the Global Neuronal Workspace. Neurosci Biobehav Rev. (PMC)
  • Pitts M. A., et al. (2018). The relationship between attention and consciousness. Neurosci Biobehav Rev. (PMC)
  • Oberauer K. (2019). Working Memory and Attention – A Conceptual Analysis. J Cogn. (PMC)
  • Olivers C. N. L., et al. (2011). Different states in visual working memory: when it guides attention and when it does not. Trends Cogn Sci. (Научный журнал)

11. Прикладные направления и технологии

Ниже — развёрнутый, дисциплинированный обзор прикладных областей, где механизмы «attention» уже оказались решающими (или обещают стать таковыми): интерфейсы мозг-компьютер (BCI), нейроинформатика, классические ML-приложения (computer vision, NLP), мульти-агентные системы, а также этические и социальные последствия «алгоритмического внимания». Для ключевых положений приведены современные и авторитетные источники (2020–2025), пригодные как ссылки в обзоре. (PMC, arXiv, Научный журнал, SpringerLink)


11.1. Применение attention-моделей в нейробиологических интерфейсах, BCI и нейроинформатике

Суть и мотивация

Attention-механизмы (и в особенности архитектуры на базе трансформеров) предлагают удобный формализм для двух задач в нейроинтерфейсах и нейроинформатике: (i) декодирование высокоразмерной, временно распределённой нейронной активности (спайки, LFP, EEG), и (ii) фьюжн / мульти-модальная интеграция (например, совместная обработка EEG + EMG + поведенческих метрик). Парадигма Q/K/V само-внимания даёт гибкий способ взвешивать вклад разных каналов / временных окон и тем самым улучшать точность и устойчивость декодеров. (PMC, Биорчив)

Практические успехи и примеры

  • Neural Data Transformers (NDT / NDT2): показали, что предобученные трансформеры эффективно обобщают между сессиями, субъектами и задачами при декодировании спайковых сигналов — ключевой шаг к «foundation models» для нейроданных. NDT2 продемонстрировал улучшение производительности на ряде BCI-задач и удобство transfer learning для нейроданных. (PMC, arXiv)
  • Transformer-based EEG/MI-BCI: за 2023–2025 гг. появились убедительные работы, показывающие, что сочетание сверточных блоков (локальные паттерны) + трансформерных блоков (глобальные/длительные зависимости) повышает точность классификации Motor Imagery и ERPs по сравнению с классическими CNN/RNN-решениями; многие из них применяют attention для пространственного/временного взвешивания каналов и для устойчивости к меж-субъектной вариабельности. (Nature)

Технические и практические соображения

  • Низкоразмерные данные и регуляризация. Нейроданные часто «малодатасетны»; трансформеры успешно работают при предобучении (masked-modelling) или гибридных архитектурах, где локальную информацию извлекают сверточные блоки, а глобальную — attention. (arXiv, Биорчив)
  • Latency / real-time. Для BCI критичны задержки: attention-блоки можно оптимизировать (sparse/linear attention, chunking, FlashAttention) или применять в латентном (bottleneck) пространстве для снижения вычислений. (PMC)
  • Интерпретируемость. Attention-веса дают удобные визуализации (какие каналы/временные окна оказались важны), но при необходимости подтверждают causal-тестами (ablation, perturbation) — см. разделы по интерпретации в обзоре. (PMC)

Перспективы

Трансформеры и attention-модули сейчас трансформируют нейроинформатику: векторные представления («tokens» = каналы или временные фрагменты), предобучение на больших репозиториях нейроданных и перекрёстное обучение между задачами — всё это ускоряет создание более надёжных и переносимых BCI-систем. (PMC, arXiv)


11.2. Применение в компьютерном зрении, NLP и мультиагентных системах

Computer vision (ViT и потомки)

  • Vision Transformers (ViT) и их наследники (Swin, DeiT, DPT и пр.) сделали self-attention стандартной опцией для задач классификации, сегментации и детекции — особенно на больших наборах данных и в задачах, где нужны дальние контекстные зависимости. Обзоры показывают, что ViT превосходят или сравнимы с CNN при адекватной предобученной базе; гибридные решения (Conv+Transformer, локальные окна) часто дают лучшее соотношение data-efficiency и производительности. (PMC, arXiv)

Практические моменты:

  • ViT полезен, когда нужен глобальный контекст (сцена, отношения объектов); Swin-подходы восстанавливают локальную иерархию, приближая модель к свойствам биологического зрения. (PMC, arXiv)

NLP и крупномасштабные языковые модели

  • Трансформеры остаются доминирующей архитектурой в NLP (translation, summarization, generation, retrieval). Self-attention позволяет моделям захватывать долгосрочные зависимости и делать контекстную генерацию эффективной; attention-head-ы и cross-attention дают гибкость при multi-modal задачах. (см. классические и обзорные источники по трансформерам). (arXiv)

Мультиагентные системы и MARL

  • В мульти-агентных RL/планировании attention используется для: (i) сетевого скоординированного обмена (кто/когда слушает кого), (ii) role assignment / dynamic routing (кто берёт на себя какую роль), и (iii) уменьшения коммуникационной нагрузки через sparsity или обучаемые маски внимания. Последние обзоры MARL и работы по attention-guided role representations показывают улучшение масштабируемости, гибкости и переносимости поведения в сложных средах. (Научный журнал, OpenReview)

11.3. Этические вопросы: «attention as bias» — влияние алгоритмического внимания на поведение пользователей

Основная проблема

Алгоритмические системы, целенаправленно «зависимые» от удержания внимания пользователей (recommender systems, feeds, push-notifications), фактически реализуют форму внимания в цифровом пространстве: их «attention-maps» (что показывать, когда и кому) сильно влияют на информационный рацион и поведение пользователей. Это порождает этические риски: манипуляция предпочтениями, усиление поляризации, усиление когнитивной нагрузки, эксплуатация ложно-положительных реакций и деградация способности к саморегуляции внимания. (SpringerLink, Nature)

Конкретные вызовы и доказательства

  • Формирование предпочтений и фильтрационные пузыри. Рекоммендеры оптимизируют на вовлечение; это приводит к усилению уже существующих предпочтений и уменьшению экспозиции к разнообразию, что влияет на общественное мнение и индивидуальные убеждения. (см. Nature / review обзоры по рекомендациям и этике). (Nature)
  • Подрыв «attentional moral skill». Философские и эмпирические работы указывают, что автоматизированные рекомендации могут подрывать способность человека осознанно распределять внимание, снижая автономию и способность критически оценивать информацию. Предложены концептуальные рамки для «этики внимания» и практические рекомендации (design for attentional justice, transparency, agency). (SpringerLink)
  • Справедливость и дискриминация. Attention-оптимизирующие алгоритмы могут отражать и усиливать предвзятости в данных (половая/расовая/географическая дискриминация), что требует справедливых метрик и корректирующих стратегий. (arXiv)

Подходы к смягчению рисков

  1. Транспарентность и «Why am I seeing this?»-функции. Обеспечение пользователю объяснений, почему тот или иной контент показан, и простых способов скорректировать сигналы. (The New Yorker)
  2. Design for attention health. Ограничение оптимизационных целей: вместо прямого максимума вовлечения использовать многокритериальные функции (well-being, diversity, serendipity). Разрабатывать интерфейсы, которые поддерживают саморегуляцию внимания. (Nature)
  3. Регуляция и стандарты. Этические рамки и нормативные механизмы (открытость, auditability, impact assessment) для алгоритмических систем, ответственных за распределение массового внимания. (SpringerLink)

Практические рекомендации для исследователя / инженера / клинициста

  1. Для BCI / нейроинформатики: используйте гибридные архитектуры (локальные фильтры + attention), предобучение на больших наборах нейроданных и проверяйте real-time latency; всегда валидируйте attention-веса с causal-тестами (ablation/perturbation). (PMC, Биорчив)
  2. Для CV / NLP / MARL: выбирайте attention-вариации под требования (ViT/Swin для vision; sparse/linear attention для длинных контекстов; attention-guided role learning для масштабируемых MARL). (PMC, Roboflow Blog, Научный журнал)
  3. Для продуктовой/этической практики: добавляйте метрики воздействия на внимание (engagement ≠ well-being), включайте пользовательские объяснения и давайте пользователю контроль над тем, как ему «внимание» распределяется системой. (Nature, SpringerLink)

Открытые проблемы и направления исследований

  • Переносимость нейромоделей: как сделать трансформеры, обученные на одном наборе нейроданных / задачах, надёжными для других субъектов и сессий (предварительное обучение, domain adaptation). (PMC)
  • Биологическая реалистичность vs эффективность: как заимствовать у биологии энергосберегающие и временные механизмы (фазовая маршрутизация, sparse spiking attention) для создания более эффективных и explainable моделей. (arXiv)
  • Этика и политика внимания: разработка операционных метрик «здоровья внимания» и их внедрение в коммерческие и научные системы. (SpringerLink, Nature)

Источники

  • Ye J., et al. Neural Data Transformer 2: Multi-context Pretraining for Neural Spiking Activity. (NDT2, 2023). PMC. — трансформеры для спайковых нейроданных; предобучение и переносимость. (PMC)
  • Takahashi S., et al. (2024). Comparison of Vision Transformers and Convolutional Neural Networks. Review (PMC). — обзор ViT vs CNN: сильные/слабые стороны и гибриды. (PMC)
  • Cong S., et al. (2024). Comprehensive Review of Transformer-based Models in Neuroscience. (review). — обзор применения трансформеров в нейронауке/психиатрии. (Wiley Online Library)
  • Ning Z., et al. (2024). Survey on Multi-Agent Reinforcement Learning (MARL). — обзор MARL, включая attention-based коммуникацию и routing. (Научный журнал)
  • Schramme J., Attention, moral skill, and algorithmic recommendation. (2023, Springer) — этика внимания и влияние алгоритмических рекомендаций. (SpringerLink)
  • Nature/Editorial & Reviews on recommender systems ethics (2023). — обзор социальных и этических последствий recommender systems. (Nature)

12. Открытые вопросы и дорожная карта на 2025+

Ниже — компактный, но практический «путеводитель» по самым острым нехваткам знаний по вниманию, главным теоретическим разногласиям и конкретной дорожной карте (эксперименты, мульти-методные дизайны и вычислительные задания), которые, по моему мнению как системного нейробиолога, дадут наибольший прогресс в 2025+ гг. Важнейшие утверждения сопровождаются ссылками на актуальные обзоры и ключевые работы (2009–2025). (Научный журнал, PMC, Cell)


12.1. Наиболее острые эмпирические пробелы (приоритеты для измерений)

  1. Причинная развязка «gain vs routing vs phase» на мульти-уровне. — Мы знаем, что внимание меняет firing rates (gain), межнейронные корреляции, фазовую синхронизацию и межрегиональную переда́чу; однако неясно, какие из этих эффектов являются первичными (driver) для улучшения поведенческой производительности в разных задачах, и как они соотносятся по времени и масштабу. Это требует одновременных мульти-областных записей + целевых вмешательств. (PMC)

  2. Микросхемная реализация нормализации / precision. — Нормализационные механизмы хорошо формализованы и объясняют множество эффектов внимания, но как именно на синаптическом / интра-микросхемном уровне реализуется деление и вариация «precision» (predictive-coding) — открытый эмпирический вопрос. Требуются параллельные измерения E/I, оптогенетика и фармакология. (PMC, Nature)

  3. Функция таламических хабов (pulvinar/LP) в реальном времени как маршрутизатора. — Данные указывают, что pulvinar модулирует кодирование и фильтрацию, но его роль как динамического «маршрутизатора» межкортикальных потоков внимания нуждается в прямых причинных тестах (оптогенетика/химиогенетика + многоканальные записи). (Cell, Nature)

  4. Соответствие attention-весов ML и causal influence в биологии. — Сравнения attention-maps трансформеров и записей мозга часто описательны; чтобы утверждать механистическое соответствие, нужны строгие вмешательства (в модели: ablative/perturbation tests; в мозге: локальные inactivations) и метрический pipeline для cross-validation представлений (RSA, encoding/decoding + causal perturbation). (PMC, Wiley Online Library)

  5. Мульти-временные шкалы: как attention координируется между миллисекундами (oscillations) и секундами (sustained attention / working memory). — Необходимо связать быстротечные осцилляторные механизмы (CTC) с медленными рекуррентными аттракторными процессами WM и длительным удержанием внимания. (PMC)


12.2. Критические теоретические разногласия (чему уделить внимание в 2025+)

  1. Attention = multiplicative gain? (biophysical / normative view) — Модель нормализации описывает многие эффекты (gain как множитель), но не объясняет routing и временную координацию сама по себе. Reynolds & Heeger — база для «gain»-подхода. (PMC)

  2. Attention = routing / selective communication? (CTC / routing view) — Fries и последователи предлагают, что attention делает эффектными определённые меж-региональные пути через фазовую синхронизацию — «communication through coherence». Это объясняет динамическую выборку каналов в Реальном времени. (PMC)

  3. Attention = precision / predictive selection? (Bayesian / predictive coding) — В этой интерпретации attention — это модуляция «precision» предсказательных ошибок; она даёт теоретическую интеграцию с inference-framework, но остаётся разведённой от микросхемной реализации. Критики указывают, что precision-концепт иногда слишком широкий. (Nature, philarchive.org)

  4. Взаимосвязь: гибридные позиции. — Современные обзоры и модели всё чаще предполагают, что ни одна из концепций не исключает другие: attention может реализовываться через gain-модуляцию в локальных популяциях при одновременном фазовом согласовании для маршрутизации и при этом отражать изменение precision в байесовской вычислительной схеме. Лучшая научная стратегия — строить гибридные, тестируемые модели. (Научный журнал)


12.3. Предложения для исследований — конкретные эксперименты и мульти-методный дизайн

Ниже — 7 приоритетных исследований (каждый — с дизайном, ожидаемыми результатами и критерием успеха).

Эксперимент A — «Pulvinar causal routing»

  • Дизайн: одновременно записывать Neuropixels (или многоканальные) в V1/V4/IT/FEF + LFP; убирать/возбуждать часть pulvinar (оптогенетика) в контексте visual search & Posner cueing; собрать поведение, eye-tracking, pupilometry.
  • Ожидаемое: при подавлении pulvinar — падение межрегиональной когерентности и ухудшение выбора при высокой конкуренции, при стимуляции — усиленная селекция/routing.
  • Критерий успеха: причинное изменение межрегиональной передачи (Granger/MVAR + PLV) и восстановление/нарушение поведения в предсказанном направлении. (Cell, Nature)

Эксперимент B — «Normalization microcircuit test»

  • Дизайн: в V4/V1 комбинировать целевые single-unit + patch-clamp / opto-манипуляции на интернейронах (PV, SOM) и блокировать GABA/NMDA/холинэргические влияния во время attention tasks.
  • Ожидаемое: манипуляции E/I или холинергии должны менять параметры нормализации (изменять denominator в divisive model) и профиль gain.
  • Критерий успеха: количественная подстройка нормализационной модели к данным до/после манипуляции. (PMC)

Эксперимент C — «Phase-causal test of CTC»

  • Дизайн: closed-loop stimulation (tACS / opto timed to LFP phase) чтобы сдвинуть фазу между двумя областями в задаче внимательной маршрутизации; записывать spiking/LFP и поведение.
  • Ожидаемое: сдвиг фазы, который делает связь невыгодной, должен ухудшать передачу и выбор; выравнивание фазы — усиливать.
  • Критерий успеха: поведенческий эффект связан с изменениями в spike-LFP phase-locking и информационном потоке. (PMC, pure.mpg.de)

Эксперимент D — «Model-to-brain perturbation loop»

  • Дизайн: тренировать RNN/Transformer-style модели на той же задаче (visual search с distractors); использовать model-guided perturbations — найти в модели «critical» units/weights, затем воспроизвести эквивалентную локальную интервенцию в мозге (микро-inactivation) и сравнить изменения поведения/нейрофизиологии.
  • Ожидаемое: если модель механистически похожа, вмешательства вызовут сходные ошибки; если нет — различия дадут подсказки, какие элементы модели исправить.
  • Критерий успеха: предсказательная точность модели по изменению поведенческого профиля при интервенции в мозге + улучшение модели после итеративной коррекции. (PMC, Proceedings of Machine Learning Research)

Эксперимент E — «Attention weights vs causal influence» (decoding + ablation)

  • Дизайн: применить NDT2/transformer к популяционным спайковым данным для получения attention-весов, затем выполнить локальные inactivations/perturbations и сравнить: (i) корреляция attention-веса ↔ влияние на декодер и (ii) causal effect in brain.
  • Ожидаемое: строгая связь покажет, в каких условиях attention-веса в моделях отражают causal influence.
  • Критерий успеха: улучшение метрик causal-correspondence после модификации модели (например, введение нормализационных или фазовых компонентов). (PMC, Биорчив)

Эксперимент F — «Lifespan multimodal cohort for attention trajectories»

  • Дизайн: крупная продольная когорта (детство → старение) с fMRI, EEG, pupilometry, cognitive batteries, PRS; включить task+naturalistic paradigms.
  • Ожидаемое: картирование индивидуальных траекторий, выявление биомаркеров риска (ADHD→дегенерация) и факторов пластичности.
  • Критерий успеха: воспроизводимый набор биомаркеров, предсказывающих траекторию функции внимания. (karger.com, PubMed)

Эксперимент G — «Spiking-transformer neuromorphic proof-of-concept»

  • Дизайн: реализовать spiking transformer / spike-attention (существующие прототипы: Spikeformer, Spike-Driven Transformer) на neuromorphic hardware и тестировать на real-time attention tasks (event cameras, BCI).
  • Ожидаемое: демонстрация того, что event-driven attention может быть энергоэффективной и сопоставимой по качеству с ANN трансформерами на задачах с временной структурой.
  • Критерий успеха: сопоставимая производительность при уменьшенном энергопотреблении / latency. (papers.neurips.cc, Научный журнал)

12.4. Потенциальные «мостовые» модели — конкретные архитектуры для связывания нейронных механизмов и self-attention

Ниже — перечень архитектур-концептов, которые (а) имеют биологическую мотивацию и (б) доступны практике ML; каждая поддаётся незамедлительной формализации и тесту.

  1. Normalization-augmented attention — добавить в формулу QK^T softmax деление, эквивалентное дивизивной нормализации (denominator как популяционная активность). Это прямо связывает Reynolds&Heeger-модель и self-attention-весу. Тест: смоделировать и сравнить с нейрофизиологией (gain profiles). (PMC)

  2. Recurrent / feedback self-attention (Transformer + feedback loops) — вернуть рекуррентность/feedback между слоями attention (iterative attention / Perceiver-style latent loops) чтобы моделировать рекуррентную интеграцию, необходимую для сознания/WM. Такие архитектуры ближе к GNW/predictive coding. (arXiv, Proceedings of Machine Learning Research)

  3. Pulvinar-style routing head (dedicated gating module) — в архитектуре выделить «routing head» (узел-хаб), который динамически модифицирует соединения между модулями (аналог MoE/pulse gating): биологически мотивирован — pulvinar; ML-реализация — attention-controller, trainable gating. (Cell)

  4. Phase-gated attention — внедрить во внимательные блоки фазовые переменные (temporal windows, oscillatory gating) — формализация CTC. Можно реализовать как learnable sinusoidal gates, синхронизируемые между слоями. Тест: проверять влияние фазовых сдвигов на routing. (PMC)

  5. Spiking / event-driven attention — перевод self-attention в SNN-парадигму (spike-Q/K/V или spike-latents) для energy-efficient, event-timed attention; уже есть реализации (Spikeformer, Spike-Driven Transformer). Это мост к биофизическим реализациям и neuromorphic hardware. (papers.neurips.cc, Научный журнал)

  6. Predictive-precision attention — ввести precision-модулятор, который масштабирует attention-веса в зависимости от предсказаний модели (precision from a meta-network). Это прямо соединяет predictive coding и attention в трансформерах. Контроль — путем фармакологического манипулирования нейромодуляторов в животных. (Nature, PMC)


Краткая дорожная карта (календарь приоритетов 2025–2029)

  • Краткосрочно (1–2 года, 2025–2026): стандартизованные репозитории задач/датасетов «behaviour+neural» (Posner/visual search/RSVP) с множеством модальностей; запуск нескольких прецедентных causal-экспериментов (pulvinar inactivation, phase-shift stimulation). (Cell, PMC)

  • Среднесрочно (3–4 года, 2027–2028): крупные мульти-лаб консорциумы для продольных когорт и многоуровневых вмешательств; разработка и публичный релиз bridge-моделей (normalization-attention, recurrent-attention, spiking-transformers) и их сравнение с нейрореалиями. (PMC, arXiv)

  • Долгосрочно (5+ лет, 2029+): интеграция neuromorphic hardware и model-driven closed-loop neurostimulation в лабораторные и клинические приложения; эмпирическое разъяснение роли attention в сознании/WM и внедрение биологически-мотивированных attention-принципов в устойчивые ML-системы. (papers.neurips.cc, Wiley Online Library)


Практические рекомендации для исследователей (what to start tomorrow)

  1. Стандартизировать задачи и интерфейсы: публиковать задачи, модели и нейроданные в BIDS-like формате, включать поведение, eye-tracking и physiological traces. (PMC)
  2. Двухсторонняя валидация: всегда сочетать model-driven predictions (attention-weights, lesion-simulations) с causal brain-manipulations. (PMC)
  3. Инструменты и метрики: развивать «causal-correspondence» метрики (как attention-weight ↔ реальное влияние), а не полагаться только на корреляционные RSA/encoding-scores. (Wiley Online Library)
  4. Мульти-временные измерения: записывать spikes + LFP + EEG/MEG + fMRI в критических подзадачах, чтобы связать ms-механизмы и network-level effects. (PMC, PubMed)

Заключение — куда вкладывать ресурсы

Для сдвига парадигмы нужны инвестиции в три направления: (i) инструменты (массовые мульти-канальные записи + опто/химиогенетика + neuromorphic HW), (ii) данные (открытые, стандартизованные многомодальные датасеты) и (iii) модели-мосты (нормализация↔attention, фазово-гейтированные трансформеры, spiking-transformers). Совокупность этих действий позволит в 2025–2030 гг. перейти от дескриптивных совпадений между ML-attention и нейрофизиологией к настоящему механистическому синтезу — и одновременно привнести биологическую робастность и энерго-эффективность в архитектуры ИИ. (PMC, Wiley Online Library, arXiv)


Источники

  • Reynolds JH, Heeger DJ. The Normalization Model of Attention. Neuron (2009). DOI: 10.1016/j.neuron.2009.01.002. (PMC)
  • Desimone R., Duncan J. Neural mechanisms of selective visual attention. Annu Rev Neurosci (1995). DOI: 10.1146/annurev.ne.18.030195.001205. (PubMed)
  • Cortes N., et al. The pulvinar as a hub of visual processing and cortical integration. Trends Neurosci (2024). (Cell)
  • Fries P. Rhythms for cognition: Communication through coherence. Neuron (2015). DOI: 10.1016/j.neuron.2015.09.034. (PMC)
  • Ye J., Pandarinath C. Neural Data Transformer 2: Multi-context Pretraining for Neural Spiking Activity. NeurIPS / PMC (2023). (PMC)
  • Jaegle A., et al. Perceiver: General Perception with Iterative Attention. (2021). (arXiv)
  • Reviews on predictive coding / precision (meta-analyses): Ficco L. Disentangling predictive processing (2021); Dutta A. Integrating predictive coding & agency (2025). (Nature, PMC)
  • Comprehensive review: Transformer-based models in neuroscience, neurology and psychiatry (2024). (Wiley Online Library)
  • Surveys and implementations of spiking transformers / Spikeformer / spike-driven Transformer (2023–2025). (papers.neurips.cc, Научный журнал)

Оглавление: