Эксперимент Сержа Булаева показал, что большинство ИИ-агентов, тестируемых для Claude Code, создают лишь визуальную имитацию презентаций PPTX, которая непригодна для профессионального редактирования.

image

Что произошло

В ходе тестирования 11 различных ИИ-субагентов было выявлено, что большинство сторонних навыков (skills) для Claude Code не умеют работать с нативными объектами формата OOXML. Вместо создания полноценных таблиц и элементов презентации, агенты генерируют «визуальные иллюзии» — наборы разрозненных текстовых блоков и графических фигур, которые лишь отдаленно напоминают нужную структуру. Полную редактируемость и корректную работу с объектами продемонстрировали только официальный навык от Anthropic и инструмент slides_maker.

Контекст

Проблема заключается в разрыве между способностью больших языковых моделей (LLM) генерировать текст или код и их умением манипулировать сложными структурированными файловыми форматами. Большинство текущих решений фокусируются на визуальном сходстве, игнорируя внутреннюю спецификацию файлов, что критично для интеграции в рабочие процессы.

Почему это важно для индустрии

Для разработчиков ИИ-инструментов это сигнал о необходимости перехода от простых интерфейсов «чат-в-файл» к агентам, работающим на уровне объектных моделей документов. Будущее агентных систем требует жесткой привязки к спецификациям форматов (например, OOXML) и внедрения новых метрик оценки качества, таких как «структурная целостность» (structural integrity) выходного файла.

Почему это важно для пользователей

Пользователи, использующие ИИ для автоматизации создания контента, могут столкнуться с тем, что вместо готовой к правкам презентации они получают набор из десятков несвязанных прямоугольников. Это заставляет тратить время на ручную переработку «агентских» файлов, что фактически сводит на нет пользу от автоматизации. При выборе инструментов стоит отдавать предпочтение решениям, работающим с нативными объектами, такими как anthropics/skills.

Что пока неизвестно / ограничения

Акценты в проблеме смещаются от чисто инженерных ограничений к рискам для профессионального контент-менеджмента и юридическим аспектам контроля данных.

Источники

Автор

Look at AI, редакция