Команди спалюють рахунок LLM і не можуть сказати, чи допоміг учорашній промпт. Цей трек — шлюз: маршрутизація моделей, стелі токенів і грошей, логи промптів (з редакцією) і контур оцінки. Це не безпека даних (ролі, on-prem, шифрування). Це не RAG. Це площина керування під асистентами, RAG і агентами.
Роблю невеликий сервіс, який викликають застосунки замість розсипу SDK: ключі в одному сховищі, квоти по командах, запасний маршрут (провайдер упав, ліміт), траси, які можна зв’язати з id тікета. Якість — на замороженому наборі: еталонні питання, очікувані цитати, наслідки тулів, а не «засновник клацнув чат один раз». Тексти: LLM-шлюз і FinOps, контур оцінки ШІ, тестування якості LLM.
Перший зріз: обгорнути один прод-шлях (внутрішній FAQ або чернетка відповіді підтримці) бюджетами й щотижневим прогоном eval. Порівняння десяти вендорів зачекає цифр. On-prem моделі входять у той самий інтерфейс, якщо політика вимагає.
Стек: шлюз на TypeScript/Node.js, Postgres для обліку, за бажанням Redis для лімітів. Eval на Python, якщо решта ML уже там. Портфоліо: cursor-telegram-integration, thinklens-bot — без обліку вартості вони лишаються демо.
Поза скоупом: закупівля GPU «для незалежності» й обіцянка мінус 40% без тижня базових логів.
Строк: робочий шлюз плюс перший eval часто за 3–7 тижнів.
Що входить
- Єдина точка входу до LLM, ключі, квоти, запасні маршрути
- Логи з редакцією й строком зберігання, який ви затвердили
- Eval-набір, розклад, короткий звіт для керівника
- Runbook: ротація ключів, підвищення стелі команді
