Представлена новая вычислительная парадигма Persistent State Machine (PSM), разработанная для радикального ускорения механизмов внимания (attention) в больших языковых моделях (LLM). Использование архитектуры Active State-machine Memory Architecture (ASMA) на базе PSM позволяет перенести вычисления непосредственно в ячейки памяти, что может снизить энергопотребление на 99% по сравнению с традиционными GPU.

Что произошло

Разработана архитектура Active State-machine Memory Architecture (ASMA), основанная на парадигме Persistent State Machine (PSM). Данное решение позволяет выполнять вычисления механизмов внимания непосредственно в памяти, что потенциально снижает трафик системной шины на 99,47% и энергопотребление на 99,0% при использовании точности INT4. Работа включает математические доказательства, результаты программных симуляций и синтезируемый Verilog RTL код для аппаратной реализации.

Контекст

Современные LLM сталкиваются с проблемой «стены памяти» (memory wall), когда процесс перемещения KV-кеша между DRAM и процессором требует в тысячи раз больше энергии, чем сами математические вычисления. Это создает критическое ограничение для масштабирования контекста и эффективности работы нейросетей на текущих архитектурах, таких как NVIDIA GPU.

Почему это важно для индустрии

Технология предлагает переход от классической архитектуры фон Неймана к концепции In-Memory Computing. Наличие Verilog RTL кода позволяет начать проектирование специализированных прототипов на уровне FPGA и ASIC. Это открывает путь к созданию нового класса сверхэффективных чипов для инференса, способных радикально снизить стоимость работы моделей с длинным контекстом.

Почему это важно для пользователей

Теоретический прорыв в архитектуре ускорителей может привести к появлению мобильных и edge-устройств, способных запускать мощные LLM локально. Это обеспечит высокую скорость генерации текста и работу с огромными объемами данных без существенного разряда батареи и необходимости постоянного подключения к облачным серверам.

Что пока неизвестно / ограничения

На текущем этапе это фундаментальное исследование, базирующееся на симуляциях. Технология требует перехода от программных моделей к реальному кремнию и не применима к текущему production-стеку на базе NVIDIA H100.

Источники

  • [Persistent State Machine: A Formal Computational Paradigm for High-Sparsity LLM Attention Acceleration [Version 6.0]](https://zenodo.org/records/21679919)

Автор

Look at AI, редакция