Підготовка даних для AI

Перетворюємо сирі дані компанії на датасет, придатний для навчання AI-моделей.

Обговорити задачуФорма контакту

Коротко опишіть мету, обмеження стеку та строки — відповім у Telegram.

Беру сирі вивантаження компанії і збираю з них датасет, на якому можна навчати модель, а не теку файлів «на потім». Таблиці, листування, заявки, скани, фото товарів і складські дампи рідко приходять однією стійкою схемою. Підготовка даних для AI — робота до fine-tuning і до впровадження: зібрати те, що вже є, очистити, прибрати дублі й сміття, розмітити те, чого модель має навчитися, і віддати файли, які читає навчання.

Продаю це як AI Dataset Engineering: сирі дані компанії стають датасетом, придатним для навчання AI-моделей. На виході — письмова схема, відтворюваний скрипт, поділ train / validation / test і звіт про якість. Не продаю загадкову теку CSV. JSONL, Parquet і WebDataset — формати здачі. Продукт — дані, у яких до першого прогону відомі зміст полів, ліцензія джерела і ризик витоку в перевірку.

Ця сторінка — про підготовку даних, не про запуск моделі в прод. Якщо корпус уже чистий і потрібен асистент, RAG або розпізнавання документів, це впровадження AI. Розмітка десяти тисяч зображень і проводка API — різні кошториси, я їх не змішую.

До меж входять джерела, очищення, дедуплікація, фільтр сміття, інструкція розмітки, synthetic data там, де живих прикладів мало, і чесний поділ. Купівля чужих баз, юридичний висновок щодо персональних даних і саме навчання моделі не входять, поки це прямо не сказано в брифі. Вузький пілот на одному джерелі й одній задачі часто займає 3–6 тижнів. Кілька джерел і розмітка зображень рахуються за обсягом, не за слоганом.

Критерії приймання

Готово, коли

  • Схема і зміст полів зафіксовані письмово
  • Поділ train / validation / test відтворюється і перевірений на витік
  • Звіт якості містить обсяги, зняті дублі та відомі прогалини

Що передаємо

  • Файли датасету в узгодженому форматі
  • Відтворюваний скрипт підготовки
  • Звіт про якість

Не входить

  • Навчання моделі і вивід у прод
  • Юридичний висновок щодо персональних даних і чужих ліцензій
  • Обсяг розмітки понад узгоджену вибірку, якщо його немає в кошторисі

Фінальний акт приймання фіксується в брифі або договорі; список вище — орієнтир для узгодження scope.

Як працюю

Запит

Ви описуєте задачу, цілі й обмеження — строки, бюджет, інфраструктура.

Уточнення

Ставлю запитання, за потреби дивлюсь код або ТЗ, фіксуємо обсяг.

План

Пропоную етапи, пріоритети й орієнтир строків; узгоджуємо формат звітності.

Розробка

Ітерації з проміжними результатами: коміти, демо, зворотний зв’язок.

Здача і підтримка

Деплой, документація за потреби; домовляємось про супровід або точкові доробки.

Поширені запитання

Натисніть на запитання, щоб розгорнути відповідь.

Що входить у підготовку даних для AI?

Датасет, придатний для навчання, плюс схема, скрипт, який його перезбирає, поділ train / validation / test і звіт про якість. Формат узгоджуємо заздалегідь: JSONL, Parquet або WebDataset.

Ви ще й навчаєте модель?

На цій сторінці ні. Підготовка закінчується даними, які читає навчання. Вивід моделі в продукт — це впровадження AI.

Як ви поводитеся з персональними даними?

Юридичний висновок я не вигадую. Позначаємо поля, схожі на персональні дані, прибираємо або маскуємо їх, якщо так сказано в брифі, і не тягнемо сирі вивантаження в листування. Формальна перевірка — окремий рядок кошторису.

Скільки триває перший пілот датасету?

Одне власне джерело й одна задача часто займають 3–6 тижнів після появи доступу. Обсяг розмітки зображень і зайві джерела змінюють оцінку.

Команда зможе перезібрати датасет сама?

Так. У приймання входять скрипт і нотатки, за якими датасет збирається з тих самих вивантажень без моєї участі.

Обговорити задачуФорма контакту

Коротко опишіть мету, обмеження стеку та строки — відповім у Telegram.