← Все статьи

NanoGPT Speedrun: 153 прогона агентов по фронтирным моделям

Prime Intellect сравнил 18 моделей на `nanoGPT`: лучший валидированный счёт у Kimi K3kimi-code, плюс 41 полная траектория агента.

NanoGPT Speedrun: 153 прогона агентов по фронтирным моделям
Содержание

Коротко

На главной Hacker News появился разбор скоростного прогона nanoGPT от компании Prime Intellect: 153 автономных прогона по 18 фронтирным моделям в одной и той же среде оптимизатора. Лучший валидированный результат — у Kimi K3kimi-code (2 974 балла, 45,8% точности); рядом в таблице — Opus 4.8claude-code и GPT-5.6 Solcodex. Отдельно выложены 41 курируемая полная траектория агента.

Что произошло

Задача не «ответить на чат», а пройти фиксированный сценарий обучения/оптимизации nanoGPT под контролем агента: вызовы инструментов, под-агенты, черновики рассуждений. Счёт и точность считаются по единому протоколу, поэтому сравнение ближе к производственному прогону, чем к изолированному вопросу из школьного теста.

По сводке выжимки лидирует Kimi K3kimi-code. Opus 4.8claude-code набрал 3 018, GPT-5.6 Solcodex — 3 042: цифры рядом, но валидированным лучшим назван именно этот прогон. Разброс по остальным моделям большой — это и есть смысл стенда: показать, где «фронтир» держит длинный агентский цикл, а где срывается.

Публичный бонус — 41 полная траектория: можно смотреть, какие инструменты вызывались, как ветвились под-агенты и что писалось в черновик рассуждений, а не только финальный балл.

Почему это важно

Обычные лидерборды меряют короткие ответы. Агентский код и донастройка упираются в другое: устойчивость плана, повторные вызовы инструментов, умение не зациклиться. Формат скоростного прогона с общим оптимизатором делает различия видимыми без маркетинговых слайдов «мы почти как топ на школьном тесте знаний».

Для команд, которые выбирают модель под агента в среде разработки или конвейере сборки, такие прогоны полезнее сырой цены за миллион токенов: видно, кто реально доходит до валидного результата в длинной цепочке.

На практике

  1. Смотрите не только топ строки, а разброс по 18 моделям: узкий лидерборд без хвоста скрывает нестабильность.
  2. Откройте хотя бы одну из 41 траекторий и сравните с тем, как ваш агент ходит по инструментам — часто расходится «красивый ответ» и реальный путь.
  3. Если выбираете модель под кодинг-агента, добавьте в отбор сценарий с длинным контекстом и повторными правками, а не только классические тесты генерации кода.
  4. Фиксируйте протокол валидации так же жёстко, как в этом прогоне: иначе сравнение «у нас на стенде» не воспроизводится.
  5. Не смешивайте сырой счёт и «валидированный лучший» без пометки — в разборе они разведены намеренно.

Итог

Этот скоростной прогон nanoGPT — редкий публичный срез агент × фронтирная модель на одной задаче с траекториями. Имеет смысл как ориентир при выборе модели под длинные циклы, а не как замена вашим собственным сценариям.