🛠 Вышел llmproxy — легковесный высокопроизводительный прокси-сервер на Python (Flask) для работы с LLM.
Инструмент эмулирует API популярных локальных сред (Ollama, OpenAI v1, llama.cpp), перенаправляя запросы к облачному API от NVIDIA. Он поддерживает чат, эмбеддинги и потоковую передачу (streaming).
🌍 Подобные прокси упрощают гибридные архитектуры, позволяя разработчикам использовать мощные облачные GPU через NVIDIA с сохранением привычного интерфейса локальных инструментов.
👤 Если вы используете Open WebUI, Ollama или SDK от OpenAI, вы можете переключиться на высокопроизводительные модели NVIDIA, просто изменив адрес сервера в настройках.
Источник 1: https://github.com/lordraw77/llmproxy
