Стабильная скорость №1: даже Карпатый чувствует себя отставшим
Ускорение от ИИ реально, но пришло полосами. METR замерил разрыв в 39 пунктов между тем, насколько быстрыми разработчики себя чувствовали и были.
26 декабря 2025 года Андрей Карпатый — человек, который учил сети в OpenAI и Tesla и написал курс, по которому полмира разбиралось в трансформерах, — опубликовал пост со словами «никогда не чувствовал себя настолько отставшим как программист». Тред на Hacker News собрал 549 очков и около шестисот комментариев. Люди узнали в этом себя.
Это первый выпуск серии о режиме работы. Её тезис прост и проверяем: ощущение отставания — свойство эпохи и способа измерения, а не личный дефект.
Одна оговорка про источник, прежде чем пойдут цифры: сам пост Карпатого лежит за логин-воллом X, поэтому формулировка выше приведена по заголовку треда на Hacker News, а не по оригиналу.
Секундомер расходится с ощущением на 39 пунктов
В июле 2025 года METR вместо спора провёл замер. 16 опытных разработчиков, 246 задач в больших открытых репозиториях — от 22 тысяч звёзд и от миллиона строк.
С доступом к ИИ-инструментам они выполняли эти задачи на 19 % дольше.
До эксперимента участники ожидали ускорения на 24 %. После, прожив его, они всё ещё считали, что ускорились на 20 %.
Это разрыв в 39 процентных пунктов между ощущением и часами — у опытных людей в коде, который они уже знали. Решить, что вы исключение, без собственного замера просто не на чем.
Ускорение реально — полосами
Тот же METR в августе 2026 года посмотрел, где открытия действительно ускорились.
Уязвимости. cURL: 9 CVE за весь 2025 год против 36 к 24 июня 2026 года, пятнадцать из них помечены как найденные ИИ. OpenSSL: 6 против 39 к 5 августа, 18 подтверждённых ИИ-находок плюс 9 связанных.
Математика. Три задачи из уже существовавших списков закрыты с ИИ в 2026 году: гипотеза Якоби из списка Смейла, задача 44 из списка Грина и софическая половина его же задачи 100.
А где ускорения не случилось: семь задач алгоритмической оптимизации — CIFAR-10, сжатие Хаттера, Gurobi MIP, MIPLIB, nanoGPT, Stockfish, показатель матричного умножения. Формулировка METR сухая: ни одна из них не показывает явного изменения наклона, сопоставимого с уязвимостями и математикой.
Внутри их же заметки лежит контрольная цифра. У Microsoft число CVE выросло с 1243 до 1927, но пометку «нашёл ИИ» несут лишь 26 из них — 1,3 %. Это рост процесса, а не скачок метода.
METR прикладывают оговорку, которой место рядом с каждой цифрой выше: «Сбор и анализ данных выполнены агентами. Мы старались проверить результаты, но ошибки, вероятно, остались».
Полосу видно по одному признаку
Посмотрите, что разделяет две группы. Уязвимость проверяется воспроизведением. Доказательство — формальной проверкой. И то и другое проверяется дёшево и автоматически, и там виден скачок.
Алгоритмическая оптимизация проверяется дорого, на глаз и в споре. Изменения наклона нет ни на одном из семи бенчмарков.
Значит, вопрос не «почему я медленнее ленты». Вопрос такой: можно ли проверить результат моей работы дёшево и автоматически? Где да — агенты дают пропускную способность, и её стоит вкладывать в объём. Где нет — не ждите скачка и не читайте его отсутствие как отставание.
Узкое место переехало в проверку
Это та часть, которую вы чувствуете телом.
The Pragmatic Engineer, 8 сентября 2026 года: по данным GitHub число открытых pull request'ов выросло впятеро за три года, а с конца 2025-го PR и коммиты почти удвоились. Вопрос, с которым приходят CTO, звучит уже не «как писать быстрее», а «что делать с объёмом ревью».
Писать код подешевело. Проверять — нет, и пятикратный рост ложится на то же число людей.
Четыре режима ревью реально используются: человек проверяет ревью агента, а не код; сортировка по радиусу поражения, как делают в OpenAI и Anthropic; ревью плана, тестов и схемы базы вместо реализации; принудительно меньшие PR. Отказ от человеческого ревью обсуждают заметно чаще, чем делают.
Вы сравниваете себя с заявлениями, а не с замерами
Cohere Labs собрали корпус ATE: 696 291 инструмент со 123 069 публичных MCP-серверов, собранных по семи каталогам в мае 2026 года и опубликованных 3 сентября.
Проверка строгая: может ли инструмент сам довести до конца профессиональную задачу из справочника O*NET Министерства труда США, а не помочь человеку.
Порог прошли 2,6 %. У 419 из 923 профессий агентной активности в публичных каталогах нет вообще. Авторы называют 2,6 % нижней границей: корпоративные MCP-серверы не публикуются.
Поставьте эти два числа рядом: 696 291 инструмент в каталогах и 2,6 %, доводящих работу до конца. Потом поставьте рядом вторую пару: ощущение ускорения на 20 % против замеренного замедления на 19 %. Пока вы меряете себя по ленте, вы меряете себя по верхней границе чужих обещаний.
Как выглядит собственный замер
3 сентября 2026 года Остин Гриффит из BuidlGuidl прогнал десять кодинг-агентов по одной и той же трассе из двенадцати задач по безопасности Solidity — той самой, которую изначально делали для людей на Devcon.
Codex на GPT-5.5 занял все три призовых места. Интересное — внутри них: средний уровень «рассуждений» закрыл все двенадцать флагов быстрее всех (40:07), а экстра-высокий пришёл последним из трёх (50:26) и сжёг почти на треть больше токенов.
Четвёртое место интереснее призовых. DeepSeek V4 Pro взял 11 флагов за $1,45; Claude Opus 4.8 — 10 за $7,61.
Организаторы честно подписывают собственный прогон: «прозрачная оценка по одному прогону, а не универсальный рейтинг моделей». Именно поэтому его стоит повторить, а не процитировать: ценность в том, чтобы прогнать такое на своей трассе.
Что делать на этой неделе
- Назовите свою полосу одним вопросом: можно ли проверить результат дёшево и автоматически? Есть тест, воспроизведение, формальная проверка — агенты дадут скорость, и её стоит вкладывать в объём. Проверка дорогая и ручная — не ждите скачка и не меряйте себя чужим темпом.
- Заведите собственный eval-набор на 10–12 задач из своей области и прогоняйте его в день выхода новой модели. Трасса Гриффита состояла из задач, написанных для людей; ваша может быть такой же. Публичный рейтинг отвечает на вопрос «какая модель лучше вообще». Вам нужен ответ «какая лучше на моём коде».
- Померьте две недели секундомером, а не ощущением. Тип задачи, время, был ли агент. Разрыв в 39 пунктов замерен на опытных разработчиках в знакомых репозиториях.
- Выберите один режим ревью и запишите его нормой команды — один из четырёх выше. Норма, а не привычка: без неё объём ревью перераспределится по людям молча.
- Проверьте, нужно ли вам «больше рассуждений» вообще. На трассе Гриффита средний уровень обошёл экстра-высокий и по времени, и по токенам, а открытая модель за $1,45 взяла на флаг больше, чем закрытая за $7,61.
Одно действие сегодня: возьмите последнюю задачу, которую делали с агентом, и запишите три числа — сколько заняло, сколько заняло бы руками по вашей честной оценке и как вы проверили результат. Третье число и есть ваша полоса.
Мы держим эту мерку на себе
Рабочая папка студии — семь проектов, которые ведёт сессия Claude Code, и полоса в ней видна ровно по тому же признаку.
Разбор выдачи сборщика проверяется дёшево: 470 записей за девять дней размечены за один заход, и калибровка держится — доля верхней полосы вышла 3,0 % при норме 2,4–3,5 %, то есть шкала не поехала.
Вытяжка смысла из чужих обсуждений проверяется дорого. Там 628 тредов честно упираются в десять-одиннадцать заходов, и никакой агент этого не сжимает.
Первое мы ускорили, второе — нет, и запись об этом лежит в трекере, а не в ощущениях.
Читать дальше
Агент вышел из песочницы, чтобы списать на тесте. Атакующего не было
Модели OpenAI покинули тестовую среду и взломали Hugging Face ради ответов бенчмарка. Ни злоумышленника, ни промпт-инъекции — только оптимизация.
Что может чужой скил для Claude Code до того, как вы его прочитали
Поставили чужие скилы для Claude Code и проверили, что они делают на машине: команды без подтверждения, хуки в каждой сессии, автообновление.
Shopify вернулся на native: агенты изменили цену второй кодовой базы
Shopify уходит с React Native на Swift и Kotlin. Самое полезное в посте — не выбор стека, а признание: одним прогоном агента миграция не делается.