Содержание
Коротко
На Хабре тестировщик опубликовал дневник одиннадцати недель работы с агентом Claude Code как с ИИ-тестировщиком. По транскриптам сессий вышло 277 часов агента и 213 часов присутствия человека, 94 подтверждённые находки — 77 у агента, 16 у автора. Картина ближе к удвоению пропускной способности, чем к обещанию «в десять раз быстрее»: на каждый час агента уходило около трёх четвертей часа человека на постановку и разбор.
Что произошло
Автор ведёт опенсорсный набор правил paranoid-qa, который заставляет агента тестировать с доказательствами, а не с красивыми отчётами. В этой статье — не методика, а таблица: откуда взялись часы, кто нашёл дефект и что случилось с каждым кандидатом. Часы агента считаются по активным интервалам в логах сессий, паузы длиннее получаса отбрасываются. Считать «от открытия окна до закрытия» нельзя: сессия, провисевшая неделю, нарисует сотни часов при полутора часах работы.
С дефектами жёстче. В счёт «найдено» идут только подтверждённые по финальному вердикту сессии. Промежуточные списки агента завысили картину почти вдвое: сначала по середине сессий вышло около восьмидесяти находок, по финальным вердиктам — около сорока. Кандидаты снимаются поздними проверками самого агента и разбором человека. Ещё около ста тридцати кандидатов до подтверждения не дожили, около сорока пяти ушли вопросом в чужую зону ответственности.
Разделение «охотничьих угодий» почти не пересекается. Агент выигрывает там, где нужен перебор состояний или чтение того, что человек читать не станет: значение из списка ушло в тело запроса как [object Object] при нормальном экране, сервер отвечал 500 вместо ожидаемой ошибки проверки, гонка на старте виджета, расхождение кодовых срезов тестового и боевого контура. Человек ловит то, что видно, только если оказаться в живом продукте: горизонтальный скролл с телефона, служебная страница без вёрстки, разъехавшийся контент при повторном открытии. Хороший совместный режим — чуйка человека и «лопата» агента: один заметил сдвиг страницы, второй за двадцать минут нашёл причину в пересчёте высоты карусели.
Почему это важно
Самый урожайный час — тот, где у агента есть эталон: макет, техническое задание, боевой контур или упавший автотест. Сверка реализации с эталоном дала больше одной находки на час, обычные UI-прогоны — около 0,6. Это как сверка поставки с накладной: пока есть список того, что должно быть в ящике, перебор идёт быстро; без списка остаётся гулять по складу и надеяться на глаз. Тест-дизайн в таблице даёт ноль дефектов продукта — и это обманчивая строка: кейсы, написанные на этом этапе, потом кормят прогоны этажом выше.
Дисциплина снимает часть ложных срабатываний, но не все. Агент отчитался о тридцати одной битой ссылке, потом сам же обошёл их с нормальным заголовком и снял все тридцать одну до отчёта. В другом случае он подставил в заглушку сети текст внутренней ошибки, увидел его на экране и оформил как находку — тестировал эхо собственной подмены. После этого в правила вошёл контрольный вопрос: значение сформировала система или я сам? Шесть пропусков на семьдесят семь агентских находок нашёл человек; два последних — на ретесте, когда агент смотрел только туда, где чинили, и не пересматривал блок целиком.
Экономика тоже ломает рекламный слоган. Тариф около ста долларов в месяц при примерно ста десяти часах агента в месяц даёт час примерно за восемьдесят рублей. Сравнивать это с часом штатного инженера «в пятнадцать раз» нельзя: на каждый час агента ушло 0,77 часа человека. На тех же задачах выходит экономия порядка шестнадцати процентов. Главный выигрыш в другом: часть работы раньше просто вычёркивали из плана — построчная сверка срезов, формы при недоступных сторонних скриптах, обход десятков ссылок в нескольких браузерах.
На практике
Текст — полевой дневник, не готовый процесс для любой команды. Имеет смысл брать из него способ счёта и правила, а не слепо копировать соотношение 77 к 16.
- Мерите активное время по транскриптам сессий: время «от открытия до закрытия» врёт в десятки раз.
- В метрику берите только финальные вердикты; промежуточные списки дефектов завышены почти вдвое.
- Давайте агенту эталон — макет, ТЗ, боевой контур, упавший тест — и просите сравнивать, а не «потыкать форму».
- На заглушках сети проверяйте поведение интерфейса, а не тексты и коды, которые сами положили в ответ.
Failот субагентов перепроверяйте лично; после правок делайте полный визуальный проход блока, не только точку фикса.- Считайте стоимость как долю своего времени плюс часы агента, а не как «агент заменил инженера».
Итог
За одиннадцать недель ИИ-тестировщик не отпустил человека «отпустить и уйти». Он удвоил объём проверяемой работы там, где есть эталон и длинный монотонный перебор, и оставил человеку присутствие в живом продукте, дедупликацию и финальный вердикт. Обещание кратного ускорения в этих цифрах не подтвердилось; подтвердилось другое: без дисциплины подсчёта и правил проверки агент легко нарисует урожай, которого нет.



Комментарии