RAG (поиск с последующей генерацией) — способ заставить ассистента отвечать по вашим регламентам, тикетам, каталогу или API, а не по памяти публичной модели. Это контур retrieval внутри внедрения ИИ. Канал (Telegram, MAX, виджет на сайте) — на странице AI-ассистентов. Если нужен только FAQ-бот без корпуса — достаточно её. Если модель должна цитировать прайс, который меняется каждую неделю, вы здесь.
Начинаю с источника правды: какие файлы, какие таблицы, кто какой срез видит. Дальше правила нарезки (заголовки лучше наивных 500 токенов для договоров и выгрузок 1С), эмбеддинги, векторное хранилище, которое можно бэкапить (часто PostgreSQL + pgvector), цикл retrieve-then-generate с цитатами. Слабая уверенность — в очередь человеку. Тихая галлюцинация в учёт или поддержку — дефект, не «креатив».
Первый вертикальный срез обычно один корпус и одна аудитория: внутренний HR, FAQ продукта или один тип документа. Считаем попадание, корректность цитат и задержку — не демо «звучит умно». Контур оценки — на LLM-шлюзе. Агенты, которые вызывают инструменты (тикет, статус заказа), — ИИ-агенты и MCP, не вторая страница RAG.
Стек: TypeScript/Node.js или Python, облачные API или on-prem по политике. Дообучение 70B-модели не дефолтный первый этап. Заметки: Production RAG в 2026. Форма портфолио: thinklens-bot и cursor-telegram-integration — мессенджер плюс опора на данные, не слайд с чатом.
Вне скоупа без отдельной строки: проиндексировать весь диск «на всякий случай», обучение на клиентских данных без договора, обещание заменить поисковую команду за неделю. Срок: FAQ-RAG часто за 3–6 недель после чистой выгрузки и правил доступа. Грязные PDF и сканы удлиняют календарь — OCR на распознавании документов.
Что входит
- Инвентарь источников, роли доступа, темы «не отвечать»
- Нарезка, эмбеддинги, retrieve/rerank, промпт с цитатами
- Staging-корпус, eval-набор, короткое сопровождение после запуска
- Runbook: как добавить документ, пересобрать индекс, читать логи
