Агрессивное внедрение инструментов генеративного ИИ в структурах армии США привело к неожиданному и быстрому исчерпанию выделенных вычислительных ресурсов, поставив под вопрос эффективность текущих стратегий масштабирования.

Что произошло
Годовой пул ресурсов в размере 100 миллионов токенов, предоставленный через платформу Ask Sage, был полностью исчерпан к середине июня 2026 года. Несмотря на объявление о внедрении «безлимитных» токенов в мае, фактическое потребление оказалось настолько высоким, что ресурсы закончились всего за месяц или полгода, в зависимости от оценки темпов использования.
Контекст
Доступ к моделям Gemini, Llama и ChatGPT в армии обеспечивается через платформу Ask Sage, которая аккредитована для работы с контролируемой несекретной информацией (CUI). Ситуация обнажила разрыв между маркетинговыми обещаниями «безлимитного» доступа и реальными техническими и финансовыми лимитами инфраструктуры.
Почему это важно для индустрии
Кейс демонстрирует фундаментальные сложности масштабирования LLM-решений в крупных государственных и корпоративных организациях. Для индустрии это сигнал о критической необходимости внедрения инструментов управления квотами (token management), развития сегмента LLM Observability и создания специализированных решений класса AI Proxy или LLM Gateway для контроля расходов и маршрутизации запросов.
Почему это важно для пользователей
Для пользователей и руководителей это служит напоминанием о том, что даже «безлимитные» предложения имеют скрытые ограничения. Бесконтрольное использование ИИ без механизмов квотирования и мониторинга в реальном времени требует жесткой инфраструктурной подготовки и перехода к модели управляемого потребления.
Что пока неизвестно / ограничения
Существуют расхождения в оценках временных рамок: некоторые данные указывают на полное исчерпание пула за один месяц (с мая по середину июня), в то время как другие источники говорят о периоде в полгода.
Источники
Автор
Look at AI, редакция
