Содержание
Коротко
На главной Hacker News появился разбор скоростного прогона nanoGPT от компании Prime Intellect: 153 автономных прогона по 18 фронтирным моделям в одной и той же среде оптимизатора. Лучший валидированный результат — у Kimi K3kimi-code (2 974 балла, 45,8% точности); рядом в таблице — Opus 4.8claude-code и GPT-5.6 Solcodex. Отдельно выложены 41 курируемая полная траектория агента.
Что произошло
Задача не «ответить на чат», а пройти фиксированный сценарий обучения/оптимизации nanoGPT под контролем агента: вызовы инструментов, под-агенты, черновики рассуждений. Счёт и точность считаются по единому протоколу, поэтому сравнение ближе к производственному прогону, чем к изолированному вопросу из школьного теста.
По сводке выжимки лидирует Kimi K3kimi-code. Opus 4.8claude-code набрал 3 018, GPT-5.6 Solcodex — 3 042: цифры рядом, но валидированным лучшим назван именно этот прогон. Разброс по остальным моделям большой — это и есть смысл стенда: показать, где «фронтир» держит длинный агентский цикл, а где срывается.
Публичный бонус — 41 полная траектория: можно смотреть, какие инструменты вызывались, как ветвились под-агенты и что писалось в черновик рассуждений, а не только финальный балл.
Почему это важно
Обычные лидерборды меряют короткие ответы. Агентский код и донастройка упираются в другое: устойчивость плана, повторные вызовы инструментов, умение не зациклиться. Формат скоростного прогона с общим оптимизатором делает различия видимыми без маркетинговых слайдов «мы почти как топ на школьном тесте знаний».
Для команд, которые выбирают модель под агента в среде разработки или конвейере сборки, такие прогоны полезнее сырой цены за миллион токенов: видно, кто реально доходит до валидного результата в длинной цепочке.
На практике
- Смотрите не только топ строки, а разброс по 18 моделям: узкий лидерборд без хвоста скрывает нестабильность.
- Откройте хотя бы одну из 41 траекторий и сравните с тем, как ваш агент ходит по инструментам — часто расходится «красивый ответ» и реальный путь.
- Если выбираете модель под кодинг-агента, добавьте в отбор сценарий с длинным контекстом и повторными правками, а не только классические тесты генерации кода.
- Фиксируйте протокол валидации так же жёстко, как в этом прогоне: иначе сравнение «у нас на стенде» не воспроизводится.
- Не смешивайте сырой счёт и «валидированный лучший» без пометки — в разборе они разведены намеренно.
Итог
Этот скоростной прогон nanoGPT — редкий публичный срез агент × фронтирная модель на одной задаче с траекториями. Имеет смысл как ориентир при выборе модели под длинные циклы, а не как замена вашим собственным сценариям.

