Агрессивное внедрение инструментов генеративного ИИ в структурах армии США привело к неожиданному и быстрому исчерпанию выделенных вычислительных ресурсов, поставив под вопрос эффективность текущих стратегий масштабирования.

image

Что произошло

Годовой пул ресурсов в размере 100 миллионов токенов, предоставленный через платформу Ask Sage, был полностью исчерпан к середине июня 2026 года. Несмотря на объявление о внедрении «безлимитных» токенов в мае, фактическое потребление оказалось настолько высоким, что ресурсы закончились всего за месяц или полгода, в зависимости от оценки темпов использования.

Контекст

Доступ к моделям Gemini, Llama и ChatGPT в армии обеспечивается через платформу Ask Sage, которая аккредитована для работы с контролируемой несекретной информацией (CUI). Ситуация обнажила разрыв между маркетинговыми обещаниями «безлимитного» доступа и реальными техническими и финансовыми лимитами инфраструктуры.

Почему это важно для индустрии

Кейс демонстрирует фундаментальные сложности масштабирования LLM-решений в крупных государственных и корпоративных организациях. Для индустрии это сигнал о критической необходимости внедрения инструментов управления квотами (token management), развития сегмента LLM Observability и создания специализированных решений класса AI Proxy или LLM Gateway для контроля расходов и маршрутизации запросов.

Почему это важно для пользователей

Для пользователей и руководителей это служит напоминанием о том, что даже «безлимитные» предложения имеют скрытые ограничения. Бесконтрольное использование ИИ без механизмов квотирования и мониторинга в реальном времени требует жесткой инфраструктурной подготовки и перехода к модели управляемого потребления.

Что пока неизвестно / ограничения

Существуют расхождения в оценках временных рамок: некоторые данные указывают на полное исчерпание пула за один месяц (с мая по середину июня), в то время как другие источники говорят о периоде в полгода.

Источники

Автор

Look at AI, редакция