← Усі статті

ШІ-тестувальник за 11 тижнів: 77 багів у агента, 16 у людини

Щоденник сесій з Claude Code: 277 годин агента, 94 підтверджені знахідки, де еталон дає врожай і чому година агента не замінює годину людини.

ШІ-тестувальник за 11 тижнів: 77 багів у агента, 16 у людини
Зміст

Коротко

На Хабрі тестувальник опублікував щоденник одинадцяти тижнів роботи з агентом Claude Code як із ШІ-тестувальником. За транскриптами сесій вийшло 277 годин агента і 213 годин присутності людини, 94 підтверджені знахідки — 77 у агента, 16 у автора. Картина ближча до подвоєння пропускної здатності, ніж до обіцянки «у десять разів швидше»: на кожну годину агента йшло близько трьох чвертей години людини на постановку і розбір.

Що сталося

Автор веде опенсорсний набір правил paranoid-qa, який змушує агента тестувати з доказами, а не з гарними звітами. У цій статті — не методика, а таблиця: звідки взялися години, хто знайшов дефект і що сталося з кожним кандидатом. Години агента рахують за активними інтервалами в логах сесій, паузи довші за пів години відкидають. Рахувати «від відкриття вікна до закриття» не можна: сесія, що провисіла тиждень, намалює сотні годин при півтори години роботи.

З дефектами жорсткіше. У рахунок «знайдено» йдуть лише підтверджені за фінальним вердиктом сесії. Проміжні списки агента завищили картину майже вдвічі: спочатку посередині сесій вийшло близько вісімдесяти знахідок, за фінальними вердиктами — близько сорока. Кандидатів знімають пізні перевірки самого агента і розбір людини. Ще близько ста тридцяти кандидатів до підтвердження не дожили, близько сорока п’яти пішли питанням у чужу зону відповідальності.

Поділ «мисливських угідь» майже не перетинається. Агент виграє там, де потрібен перебір станів або читання того, що людина читати не стане: значення зі списку пішло в тіло запиту як [object Object] при нормальному екрані, сервер відповідав 500 замість очікуваної помилки перевірки, гонка на старті віджета, розбіжність кодових зрізів тестового і бойового контуру. Людина ловить те, що видно лише якщо опинитися в живому продукті: горизонтальний скрол з телефона, службова сторінка без верстки, роз’їханий контент при повторному відкритті. Гарний спільний режим — чуйка людини і «лопата» агента: один помітив зсув сторінки, другий за двадцять хвилин знайшов причину в перерахунку висоти каруселі.

Чому це важливо

Найурожайніша година — та, де в агента є еталон: макет, технічне завдання, бойовий контур або впалий автотест. Звірка реалізації з еталоном дала більше однієї знахідки на годину, звичайні UI-прогони — близько 0,6. Це як звірка поставки з накладною: поки є список того, що має бути в ящику, перебір іде швидко; без списку лишається гуляти складом і сподіватися на око. Тест-дизайн у таблиці дає нуль дефектів продукту — і це оманливий рядок: кейси, написані на цьому етапі, потім годують прогони поверхом вище.

Дисципліна знімає частину хибних спрацьовувань, але не всі. Агент відзвітував про тридцять одну биту посилання, потім сам обійшов їх із нормальним заголовком і зняв усі тридцять одну до звіту. В іншому випадку він підставив у заглушку мережі текст внутрішньої помилки, побачив його на екрані й оформив як знахідку — тестував відлуння власної підміни. Після цього в правила увійшло контрольне питання: значення сформувала система чи я сам? Шість пропусків на сімдесят сім агентських знахідок знайшла людина; два останні — на ретесті, коли агент дивився лише туди, де чинили, і не переглядав блок цілком.

Економіка теж ламає рекламний слоган. Тариф близько ста доларів на місяць при приблизно ста десяти годинах агента на місяць дає годину приблизно за вісімдесят рублів. Порівнювати це з годиною штатного інженера «у п’ятнадцять разів» не можна: на кожну годину агента пішло 0,77 години людини. На тих самих задачах виходить економія порядку шістнадцяти відсотків. Головний виграш в іншому: частину роботи раніше просто викреслювали з плану — построкова звірка зрізів, форми при недоступних сторонніх скриптах, обхід десятків посилань у кількох браузерах.

На практиці

Текст — польовий щоденник, не готовий процес для будь-якої команди. Має сенс брати з нього спосіб рахунку і правила, а не сліпо копіювати співвідношення 77 до 16.

  1. Міряйте активний час за транскриптами сесій: час «від відкриття до закриття» бреше в десятки разів.
  2. У метрику беріть лише фінальні вердикти; проміжні списки дефектів завищені майже вдвічі.
  3. Давайте агенту еталон — макет, ТЗ, бойовий контур, впалий тест — і просіть порівнювати, а не «потикати форму».
  4. На заглушках мережі перевіряйте поведінку інтерфейсу, а не тексти і коди, які самі поклали у відповідь.
  5. Fail від субагентів переперевіряйте особисто; після правок робіть повний візуальний прохід блока, не лише точку фіксу.
  6. Рахуйте вартість як частку свого часу плюс години агента, а не як «агент замінив інженера».

Підсумок

За одинадцять тижнів ШІ-тестувальник не відпустив людину «відпустити й піти». Він подвоїв обсяг перевірюваної роботи там, де є еталон і довгий монотонний перебір, і залишив людині присутність у живому продукті, дедуплікацію і фінальний вердикт. Обіцянка кратного прискорення в цих цифрах не підтвердилася; підтвердилося інше: без дисципліни підрахунку і правил перевірки агент легко намалює врожай, якого немає.

Коментарі

Завантаження коментарів…