Исследователи из Chongqing University, Zhejiang University и других учреждений опубликовали 27 августа 2026 года преprint arXiv 2608.26882 «PLCBench: Can Autonomous LLM Agents Turn PLC Access into Sustained Physical Impact?» — первый бенчмарк, где автономные LLM-агенты оцениваются против реальных коммерческих ПЛК в режиме hardware-in-the-loop. Из 240 эпизодов лишь 75, то есть 31,3%, завершились устойчивым физическим воздействием, а большинство срывов происходит ещё до первой валидной операции чтения через vendor-native протокол. Код и программный конвейер открыты, поэтому бенчмарк можно воспроизвести без промышленного оборудования. Работа впервые даёт количественный ориентир того, где именно ломается агентный цикл против «железных мозгов» заводов и насколько интенсивным этот риск следует считать сегодня.

image

Что произошло

Авторы работы — Yitian Zhou, Jingyu Zheng, Qiliang Jiang, Linkang Du и коллеги — выложили преprint статьи «PLCBench: Can Autonomous LLM Agents Turn PLC Access into Sustained Physical Impact?». Эксперименты охватили 4 коммерческих ПЛК, 4 промышленные нагрузки и 5 семейств LLM, всего 240 эпизодов. Итоги распадаются на воронку сбоев: 98 эпизодов остановились до первого валидного чтения через vendor-native протокол, 62 дошли до записи в процесс, но не удержали целевое значение, и 75 эпизодов, или 31,3%, достигли устойчивого физического воздействия. Успешность эпизода определяет независимый детерминированный верификатор: по фиксированным правилам он проверяет записи в ПЛК-объекты и состояние процесса, а в диагностических целях раскрывает шесть скрытых флагов вместо субъективной оценки судьи-модели.

Контекст

ПЛК, программируемый логический контроллер, — это специализированный компьютер, который напрямую управляет конвейерами, станками и инженерными системами, поэтому такие устройства относят к OT-сегменту критической инфраструктуры. Ранее агентные возможности против подобного железа оценивались в основном аналитически или в чисто программной эмуляции, без реальных контроллеров в контуре. Отличие PLCBench — сочетание трёх элементов: коммерческие ПЛК, работающие в режиме hardware-in-the-loop с закрытым контуром симуляции процесса, где действия агента реально меняют физическое состояние, плюс детерминированный верификатор успеха. Работа агента разбита на цепочку чтение, запись, удержание эффекта, и именно такая декомпозиция превращает оценку из одного числа в карту того, на каком шаге попытка сорвалась.

Почему это важно для индустрии

Для вендоров ПЛК и владельцев критической инфраструктуры бенчмарк указывает конкретные точки защиты. Ключевым измеримым рычагом оказалась наблюдаемость процесса: при богатой телеметрии условная доля достижения цели после успешной записи растёт с 44,2% до 64,0%, то есть объём видимых агенту данных напрямую масштабирует риск. Отсюда следуют практические направления защит — ограничение телеметрии для агентных сессий и детектирование vendor-native операций записи на уровне протокола, а не только разгон типового «взлом-stack» на уровне софта. Для команд, которые строят и оценивают агентов, ценность в другом: открытый конвейер воспроизводит весь eval-цикл без промышленного оборудования, а методологию детерминированного верификатора с шестью диагностическими флагами можно перенести во внутренние карты оценки многошаговых агентных workflow, где каждый шаг проверяется правилом, а не ощущением LLM-судьи.

Почему это важно для пользователей

Читателю, который следит за развитием агентов, бенчмарк даёт трезвый ответ на вопрос, что сегодняшние модели реально умеют против заводского железа: доступ к ПЛК превращается в устойчивое физическое воздействие в среднем в трети попыток, а подавляющая часть неудач случается на самом старте, до первой легитимной операции чтения. Узкое место — не тонкая манипуляция процессом и не эффектный сценарий взлома, а элементарное установление валидного чтения через vendor-native протокол. Тем, кто сам собирает или оценивает агентов, вход порог минимален: код и конвейер опубликованы и запускаются без оборудования, а набор флагов верификатора показывает, на каком именно шаге собственный агент срывается, и позволяет сопоставить его с результатами пяти семейств моделей из статьи.

Что пока неизвестно / ограничения

База бенчмарка узкая: 4 коммерческих ПЛК, 4 нагрузки и 5 семейств LLM, поэтому числовые доли могут не переноситься на другие контроллеры, протоколы и отрасли. Гипотеза о том, что надёжный структурированный слой доступа к ПЛК, шлюз или API, снимает целый этап сбоев, внутри самого бенчмарка не проверялась — это правдоподобный вывод из формы воронки, а не измеренный результат. Ожидания массовых независимых воспроизведений, производных бенчмарков и стандартизации hardware-in-the-loop оценок остаются интерпретациями, а не установленными фактами. Кроме того, работа опубликована как преprint, и числовые результаты могут уточниться после рецензирования и в следующих версиях.

Источники

Автор

Look at AI, редакция