Запит
Ви описуєте задачу, цілі й обмеження — строки, бюджет, інфраструктура.
Новини для розробників без шуму — My Dev News у Telegram.

Перетворюємо сирі дані компанії на датасет, придатний для навчання AI-моделей.
Коротко опишіть мету, обмеження стеку та строки — відповім у Telegram.
Беру сирі вивантаження компанії і збираю з них датасет, на якому можна навчати модель, а не теку файлів «на потім». Таблиці, листування, заявки, скани, фото товарів і складські дампи рідко приходять однією стійкою схемою. Підготовка даних для AI — робота до fine-tuning і до впровадження: зібрати те, що вже є, очистити, прибрати дублі й сміття, розмітити те, чого модель має навчитися, і віддати файли, які читає навчання.
Продаю це як AI Dataset Engineering: сирі дані компанії стають датасетом, придатним для навчання AI-моделей. На виході — письмова схема, відтворюваний скрипт, поділ train / validation / test і звіт про якість. Не продаю загадкову теку CSV. JSONL, Parquet і WebDataset — формати здачі. Продукт — дані, у яких до першого прогону відомі зміст полів, ліцензія джерела і ризик витоку в перевірку.
Ця сторінка — про підготовку даних, не про запуск моделі в прод. Якщо корпус уже чистий і потрібен асистент, RAG або розпізнавання документів, це впровадження AI. Розмітка десяти тисяч зображень і проводка API — різні кошториси, я їх не змішую.
До меж входять джерела, очищення, дедуплікація, фільтр сміття, інструкція розмітки, synthetic data там, де живих прикладів мало, і чесний поділ. Купівля чужих баз, юридичний висновок щодо персональних даних і саме навчання моделі не входять, поки це прямо не сказано в брифі. Вузький пілот на одному джерелі й одній задачі часто займає 3–6 тижнів. Кілька джерел і розмітка зображень рахуються за обсягом, не за слоганом.
Фінальний акт приймання фіксується в брифі або договорі; список вище — орієнтир для узгодження scope.
Ви описуєте задачу, цілі й обмеження — строки, бюджет, інфраструктура.
Ставлю запитання, за потреби дивлюсь код або ТЗ, фіксуємо обсяг.
Пропоную етапи, пріоритети й орієнтир строків; узгоджуємо формат звітності.
Ітерації з проміжними результатами: коміти, демо, зворотний зв’язок.
Деплой, документація за потреби; домовляємось про супровід або точкові доробки.
Натисніть на запитання, щоб розгорнути відповідь.
Датасет, придатний для навчання, плюс схема, скрипт, який його перезбирає, поділ train / validation / test і звіт про якість. Формат узгоджуємо заздалегідь: JSONL, Parquet або WebDataset.
На цій сторінці ні. Підготовка закінчується даними, які читає навчання. Вивід моделі в продукт — це впровадження AI.
Юридичний висновок я не вигадую. Позначаємо поля, схожі на персональні дані, прибираємо або маскуємо їх, якщо так сказано в брифі, і не тягнемо сирі вивантаження в листування. Формальна перевірка — окремий рядок кошторису.
Одне власне джерело й одна задача часто займають 3–6 тижнів після появи доступу. Обсяг розмітки зображень і зайві джерела змінюють оцінку.
Так. У приймання входять скрипт і нотатки, за якими датасет збирається з тих самих вивантажень без моєї участі.
Коротко опишіть мету, обмеження стеку та строки — відповім у Telegram.