Підготовка текстових датасетів перетворює документи, заявки, листування і сторінки бази знань на записи, на яких модель може вчитися. На кожному рядку лишаються мова, джерело і стійкий ідентифікатор. Текстові датасети — це ще не файли для fine-tuning чату: спочатку текст має бути цілим, у потрібному кодуванні і нарізаним там, де його нарізала б людина.
Знімаю лише той шаблон, який бриф назвав сміттям. Не переводжу корпус «щоб стало більше», якщо переклад не є задачею. Нарізка йде за одиницею мітки: заявка, абзац, репліка. Змішані мови позначаю, а не зливаю в одну. Персональні дані маскую, коли бриф каже, що модель їх бачити не повинна.
Приймання — вибірка записів з ідентифікаторами джерела, нотатка, як різали текст, і лічильник рядків, знятих як порожні або нечиткі. Формат здачі — наступний крок: JSONL, Parquet і WebDataset. Один корпус часто займає 2–4 тижні після появи вивантажень.
