🤖 Память ИИ-агентов: стор обошёл файлы на +28,7 п.п.

Инженер Пин Линь (pinglin.tw) прогнал три формы памяти агентов через LongMemEval и LoCoMo на одной модели: файлы, которые курует сама модель (Claude Code, Cursor), структурированный стор (mem0, Letta, Zep) и RL-опыт в весах (MemHarness).

🌍 В индустрии memory-вендоров опубликованные метрики несравнимы: LoCoMo-результат Zep фигурировал как 84, 58,44 и 75,14, а mem0 — как 67 и 92,5 из-за разных методик. Здесь вместо одного числа — построчные вердикты с верификатором: скрипт verify_all.py пересчитывает каждую цифру и падает при несовпадении.

👤 Для своего агента файловая память (MEMORY.md плюс grep) дешева и честно отвечает «не знаю», но на длинных историях проигрывает стору: на LongMemEval-S у стора +28,7 п.п. точности и 19,3 тыс. токенов на вопрос против 286,5 тыс.

Источник 1: https://pinglin.tw/blog/the-shapes-of-agent-memory/ Источник 2: https://github.com/a40-labs/memory