Команды сжигают счёт LLM и не могут сказать, помог ли вчерашний промпт. Этот трек — шлюз: маршрутизация моделей, потолки токенов и денег, логи промптов (с редакцией) и контур оценки. Это не безопасность данных (роли, on-prem, шифрование). Это не RAG. Это плоскость управления под ассистентами, RAG и агентами.
Делаю небольшой сервис, который вызывают приложения вместо россыпи SDK: ключи в одном хранилище, квоты по командам, запасной маршрут (провайдер лёг, лимит), трассы, которые можно связать с id тикета. Качество — на замороженном наборе: эталонные вопросы, ожидаемые цитаты, исходы тулов, а не «основатель кликнул чат один раз». Тексты: LLM-шлюз и FinOps, контур оценки ИИ, тестирование качества LLM.
Первый срез: обернуть один прод-путь (внутренний FAQ или черновик ответа поддержке) бюджетами и еженедельным прогоном eval. Сравнение десяти вендоров подождёт цифр. On-prem модели входят в тот же интерфейс, если политика требует.
Стек: шлюз на TypeScript/Node.js, Postgres для учёта, по желанию Redis для лимитов. Eval на Python, если остальной ML уже там. Портфолио: cursor-telegram-integration, thinklens-bot — без учёта стоимости они остаются демо.
Вне скоупа: закупка GPU «для независимости» и обещание минус 40% без недели базовых логов.
Срок: рабочий шлюз плюс первый eval часто за 3–7 недель. Если уже есть разрозненные вызовы OpenAI в трёх репозиториях, первый milestone — свести их в один клиент и неделю мерить факт, а не «оптимизировать вслепую».
Что входит
- Единая точка входа к LLM, ключи, квоты, запасные маршруты
- Логи с редакцией и сроком хранения, который вы утвердили
- Eval-набор, расписание, короткий отчёт для руководителя
- Runbook: ротация ключей, повышение потолка команде
