Дедуплікація не дає моделі завчити один приклад двічі і потім виглядати розумною на перевірці, куди цей приклад витік. Порівнюю записи за стійкими ідентифікаторами, нормалізованим текстом і хешами майже-дублів, а не лише за іменами файлів. Дедуплікація стоїть після очищення і до поділу train / validation / test.
Не видаляю єдину копію рідкісного класу лише тому, що у двох рядків спільний префікс. Політику пишу явно: точний збіг, збіг після нормалізації або поріг схожості, який можна пояснити. Для зображень хеш ловить зменшену копію. Для тексту нормалізований хеш ловить повтор шапки. Сміття — інший прохід: сміття не те саме, що дубль доброго рядка. Див. видалення сміття.
Приймання — лічильник «до і після», вибірка знятих пар і перевірка, що в прикладу з validation немає близнюка в train. Зняті ключі лишаються у файлі поруч. Одне джерело часто займає 1–2 тижні, коли схема вже є.
