ИИ6 мин чтения

Стабильная скорость №1: даже Карпатый чувствует себя отставшим

Ускорение от ИИ реально, но пришло полосами. METR замерил разрыв в 39 пунктов между тем, насколько быстрыми разработчики себя чувствовали и были.

26 декабря 2025 года Андрей Карпатый — человек, который учил сети в OpenAI и Tesla и написал курс, по которому полмира разбиралось в трансформерах, — опубликовал пост со словами «никогда не чувствовал себя настолько отставшим как программист». Тред на Hacker News собрал 549 очков и около шестисот комментариев. Люди узнали в этом себя.

Это первый выпуск серии о режиме работы. Её тезис прост и проверяем: ощущение отставания — свойство эпохи и способа измерения, а не личный дефект.

Одна оговорка про источник, прежде чем пойдут цифры: сам пост Карпатого лежит за логин-воллом X, поэтому формулировка выше приведена по заголовку треда на Hacker News, а не по оригиналу.

Секундомер расходится с ощущением на 39 пунктов

В июле 2025 года METR вместо спора провёл замер. 16 опытных разработчиков, 246 задач в больших открытых репозиториях — от 22 тысяч звёзд и от миллиона строк.

С доступом к ИИ-инструментам они выполняли эти задачи на 19 % дольше.

До эксперимента участники ожидали ускорения на 24 %. После, прожив его, они всё ещё считали, что ускорились на 20 %.

Это разрыв в 39 процентных пунктов между ощущением и часами — у опытных людей в коде, который они уже знали. Решить, что вы исключение, без собственного замера просто не на чем.

Ускорение реально — полосами

Тот же METR в августе 2026 года посмотрел, где открытия действительно ускорились.

Уязвимости. cURL: 9 CVE за весь 2025 год против 36 к 24 июня 2026 года, пятнадцать из них помечены как найденные ИИ. OpenSSL: 6 против 39 к 5 августа, 18 подтверждённых ИИ-находок плюс 9 связанных.

Математика. Три задачи из уже существовавших списков закрыты с ИИ в 2026 году: гипотеза Якоби из списка Смейла, задача 44 из списка Грина и софическая половина его же задачи 100.

А где ускорения не случилось: семь задач алгоритмической оптимизации — CIFAR-10, сжатие Хаттера, Gurobi MIP, MIPLIB, nanoGPT, Stockfish, показатель матричного умножения. Формулировка METR сухая: ни одна из них не показывает явного изменения наклона, сопоставимого с уязвимостями и математикой.

Внутри их же заметки лежит контрольная цифра. У Microsoft число CVE выросло с 1243 до 1927, но пометку «нашёл ИИ» несут лишь 26 из них — 1,3 %. Это рост процесса, а не скачок метода.

METR прикладывают оговорку, которой место рядом с каждой цифрой выше: «Сбор и анализ данных выполнены агентами. Мы старались проверить результаты, но ошибки, вероятно, остались».

Полосу видно по одному признаку

Посмотрите, что разделяет две группы. Уязвимость проверяется воспроизведением. Доказательство — формальной проверкой. И то и другое проверяется дёшево и автоматически, и там виден скачок.

Алгоритмическая оптимизация проверяется дорого, на глаз и в споре. Изменения наклона нет ни на одном из семи бенчмарков.

Значит, вопрос не «почему я медленнее ленты». Вопрос такой: можно ли проверить результат моей работы дёшево и автоматически? Где да — агенты дают пропускную способность, и её стоит вкладывать в объём. Где нет — не ждите скачка и не читайте его отсутствие как отставание.

Узкое место переехало в проверку

Это та часть, которую вы чувствуете телом.

The Pragmatic Engineer, 8 сентября 2026 года: по данным GitHub число открытых pull request'ов выросло впятеро за три года, а с конца 2025-го PR и коммиты почти удвоились. Вопрос, с которым приходят CTO, звучит уже не «как писать быстрее», а «что делать с объёмом ревью».

Писать код подешевело. Проверять — нет, и пятикратный рост ложится на то же число людей.

Четыре режима ревью реально используются: человек проверяет ревью агента, а не код; сортировка по радиусу поражения, как делают в OpenAI и Anthropic; ревью плана, тестов и схемы базы вместо реализации; принудительно меньшие PR. Отказ от человеческого ревью обсуждают заметно чаще, чем делают.

Вы сравниваете себя с заявлениями, а не с замерами

Cohere Labs собрали корпус ATE: 696 291 инструмент со 123 069 публичных MCP-серверов, собранных по семи каталогам в мае 2026 года и опубликованных 3 сентября.

Проверка строгая: может ли инструмент сам довести до конца профессиональную задачу из справочника O*NET Министерства труда США, а не помочь человеку.

Порог прошли 2,6 %. У 419 из 923 профессий агентной активности в публичных каталогах нет вообще. Авторы называют 2,6 % нижней границей: корпоративные MCP-серверы не публикуются.

Поставьте эти два числа рядом: 696 291 инструмент в каталогах и 2,6 %, доводящих работу до конца. Потом поставьте рядом вторую пару: ощущение ускорения на 20 % против замеренного замедления на 19 %. Пока вы меряете себя по ленте, вы меряете себя по верхней границе чужих обещаний.

Как выглядит собственный замер

3 сентября 2026 года Остин Гриффит из BuidlGuidl прогнал десять кодинг-агентов по одной и той же трассе из двенадцати задач по безопасности Solidity — той самой, которую изначально делали для людей на Devcon.

Codex на GPT-5.5 занял все три призовых места. Интересное — внутри них: средний уровень «рассуждений» закрыл все двенадцать флагов быстрее всех (40:07), а экстра-высокий пришёл последним из трёх (50:26) и сжёг почти на треть больше токенов.

Четвёртое место интереснее призовых. DeepSeek V4 Pro взял 11 флагов за $1,45; Claude Opus 4.8 — 10 за $7,61.

Организаторы честно подписывают собственный прогон: «прозрачная оценка по одному прогону, а не универсальный рейтинг моделей». Именно поэтому его стоит повторить, а не процитировать: ценность в том, чтобы прогнать такое на своей трассе.

Что делать на этой неделе

  1. Назовите свою полосу одним вопросом: можно ли проверить результат дёшево и автоматически? Есть тест, воспроизведение, формальная проверка — агенты дадут скорость, и её стоит вкладывать в объём. Проверка дорогая и ручная — не ждите скачка и не меряйте себя чужим темпом.
  2. Заведите собственный eval-набор на 10–12 задач из своей области и прогоняйте его в день выхода новой модели. Трасса Гриффита состояла из задач, написанных для людей; ваша может быть такой же. Публичный рейтинг отвечает на вопрос «какая модель лучше вообще». Вам нужен ответ «какая лучше на моём коде».
  3. Померьте две недели секундомером, а не ощущением. Тип задачи, время, был ли агент. Разрыв в 39 пунктов замерен на опытных разработчиках в знакомых репозиториях.
  4. Выберите один режим ревью и запишите его нормой команды — один из четырёх выше. Норма, а не привычка: без неё объём ревью перераспределится по людям молча.
  5. Проверьте, нужно ли вам «больше рассуждений» вообще. На трассе Гриффита средний уровень обошёл экстра-высокий и по времени, и по токенам, а открытая модель за $1,45 взяла на флаг больше, чем закрытая за $7,61.

Одно действие сегодня: возьмите последнюю задачу, которую делали с агентом, и запишите три числа — сколько заняло, сколько заняло бы руками по вашей честной оценке и как вы проверили результат. Третье число и есть ваша полоса.

Мы держим эту мерку на себе

Рабочая папка студии — семь проектов, которые ведёт сессия Claude Code, и полоса в ней видна ровно по тому же признаку.

Разбор выдачи сборщика проверяется дёшево: 470 записей за девять дней размечены за один заход, и калибровка держится — доля верхней полосы вышла 3,0 % при норме 2,4–3,5 %, то есть шкала не поехала.

Вытяжка смысла из чужих обсуждений проверяется дорого. Там 628 тредов честно упираются в десять-одиннадцать заходов, и никакой агент этого не сжимает.

Первое мы ускорили, второе — нет, и запись об этом лежит в трекере, а не в ощущениях.

Сергей Палий

Основатель, Sepia Software

Обо мне

Читать дальше

Все статьи