Расходы на языковые модели растут не так, как подсказывает интуиция
Функция, которая в демо стоит копейки, в проде обходится в тысячи долларов в месяц — и почти никогда из-за цены за токен. Куда уходят деньги на самом деле.
Чат-бот, который отвечает по вашим материалам, ассистент, который квалифицирует и записывает на звонок, LLM-функция внутри продукта, который вы уже продаёте. С опорой на ваши данные и передачей человеку там, где это важно — а не демо, которое рассыпается на втором вопросе.
Чат-бот, который знает ваш продукт, потому что отвечает по вашим материалам, а не по тому, что запомнила модель. Говорит «не знаю» вместо того, чтобы придумать, и передаёт разговор человеку, как только вопрос выходит за его рамки.
Обсудить задачуПосетитель, который ушёл бы, ничего не спросив, вместо этого получает разговор: что ему нужно, какой вариант подходит и запись на следующий шаг. Всё, что ассистент узнал, попадает в CRM, а не в лог чата, который никто не читает.
Обсудить задачуGPT или Claude внутри продукта, который у вас уже есть — генерация, саммари, извлечение данных, смысловой поиск — как настоящая функция, с состоянием загрузки, состоянием ошибки и предсказуемой стоимостью.
Обсудить задачуКогда одного ответа мало: агенты, которые делают несколько шагов, вызывают ваши API и работают по вашим документам, каталогу или базе знаний — с трассировкой, в которую можно заглянуть, когда результат неверный.
Обсудить задачуЧем пользуемся, когда встраиваем ИИ в продукт.
Claude · GPT
RAG · векторный поиск
Агенты · вызов инструментов
Next.js · Node · Python
Сайт · Telegram · WhatsApp
Оценки · контроль расходов
Пять, которые всплывают почти на каждом созвоне.
Тем, кто по другую сторону. Эта страница — про ИИ, с которым взаимодействуют ваши клиенты: чат-бот на сайте, ассистент в воронке, LLM-функция в продукте. Автоматизация бизнеса — про ИИ, которого ваша команда никому не показывает: входящие и поддержка, обработка документов, маршрутизация лидов, внутренние отчёты. Разный покупатель, разная метрика успеха — поэтому это намеренно две страницы, а не одна длинная.
Три вещи, по порядку. Он отвечает по вашим материалам, а не по памяти модели — значит, есть с чем сверить ответ. Ему разрешено сказать «не знаю» и передать вопрос человеку: отказ — это правильный ответ, а не сбой. И ответы прогоняются по набору реальных вопросов до запуска и после каждой правки промпта, чтобы починка одного не ломала тихо то, что работало.
Ту, что подходит под задачу — Claude и GPT оба сильны, но сильны в разном. Интеграция уходит за свой тонкий слой, поэтому поменять модель позже — это правка конфига, а не переписывание. Привязка к одному вендору — риск на рынке, где лучший вариант меняется каждые несколько месяцев.
Чат-бот, отвечающий по вашим материалам, — это сборка на 2-3 недели. Ассистент, связанный с CRM и записью на звонок, или LLM-функция внутри существующего продукта — зависит от того, куда ему нужно дотянуться; это разговор про объём, а не цифра, которую я могу честно поставить на страницу.
Расход на модель — реальная строка в месячных расходах, поэтому её считают до сборки, а не обнаруживают после запуска. Дешёвые обращения уходят на более дешёвую модель, повторяющиеся вопросы кешируются, и стоит жёсткий потолок, чтобы всплеск трафика или один злоупотребляющий пользователь не превратились в неожиданный счёт.
Функция, которая в демо стоит копейки, в проде обходится в тысячи долларов в месяц — и почти никогда из-за цены за токен. Куда уходят деньги на самом деле.