Зміст
Коротко
На головній Hacker News з’явився розбір швидкісного прогону nanoGPT від компанії Prime Intellect: 153 автономні прогони на 18 фронтирних моделях в одному середовищі оптимізатора. Найкращий валідований результат — у Kimi K3kimi-code (2 974 бали, 45,8% точності); поруч у таблиці — Opus 4.8claude-code і GPT-5.6 Solcodex. Окремо викладено 41 курована повна траєкторія агента.
Що сталося
Завдання не «відповісти в чаті», а пройти фіксований сценарій навчання/оптимізації nanoGPT під контролем агента: виклики інструментів, під-агенти, чернетки міркувань. Рахунок і точність рахують за єдиним протоколом, тож порівняння ближче до виробничого прогону, ніж до ізольованого питання зі шкільного тесту.
За зведенням витягу лідирує Kimi K3kimi-code. Opus 4.8claude-code набрав 3 018, GPT-5.6 Solcodex — 3 042: цифри поруч, але валідованим найкращим названо саме цей прогін. Розкид по інших моделях великий — у цьому й сенс стенду: показати, де «фронтир» тримає довгий агентський цикл, а де зривається.
Публічний бонус — 41 повна траєкторія: можна дивитися, які інструменти викликалися, як гілкувалися під-агенти і що писалося в чернетку міркувань, а не лише фінальний бал.
Чому це важливо
Звичайні лідерборди міряють короткі відповіді. Агентський код і донавчання впираються в інше: стійкість плану, повторні виклики інструментів, уміння не зациклитися. Формат швидкісного прогону зі спільним оптимізатором робить відмінності видимими без маркетингових слайдів «ми майже як топ на шкільному тесті знань».
Для команд, що обирають модель під агента в середовищі розробки чи конвеєрі збірки, такі прогони корисніші за сиру ціну за мільйон токенів: видно, хто реально доходить до валідного результату в довгому ланцюжку.
На практиці
- Дивіться не лише топ рядка, а розкид по 18 моделях: вузький лідерборд без хвоста ховає нестабільність.
- Відкрийте хоча б одну з 41 траєкторій і порівняйте з тим, як ваш агент ходить по інструментах.
- Якщо обираєте модель під кодинг-агента, додайте в відбір сценарій із довгим контекстом і повторними правками, а не лише класичні тести генерації коду.
- Фіксуйте протокол валідації так само жорстко, як у цьому прогоні: інакше порівняння «у нас на стенді» не відтворюється.
- Не змішуйте сирий рахунок і «валідований найкращий» без позначки — у розборі їх розведено навмисно.
Підсумок
Цей швидкісний прогін nanoGPT — рідкісний публічний зріз агент × фронтирна модель на одному завданні з траєкторіями. Має сенс як орієнтир при виборі моделі під довгі цикли, а не як заміна вашим власним сценаріям.

