Про то, какую модель брать под задачу, мы уже писали. Но есть вопрос, который всплывает позже и бьёт больнее: сколько ИИ стоит в эксплуатации. Разработку оценивают все, а вот счёт, который приходит каждый месяц и растёт вместе с числом пользователей, обычно обнаруживают постфактум.
Эта статья — про деньги: три схемы подключения ИИ, как считать цену одного обращения и что делать, чтобы расход не обгонял выручку.
01 · Две строки бюджета, а не одна
AI в продукте — это всегда две разные статьи расходов:
- Разработка функции — разовая. Интеграция, промпты и их отладка, обработка ошибок и таймаутов, экраны, лимиты, админка. Обычно 150–400 тыс ₽ сверх базовой сметы приложения, в зависимости от сложности сценария.
- Потребление моделей — ежемесячная и растущая. Зависит не от вас, а от активности пользователей.
Опасная фраза в проекте: «AI подключим, там же просто API». Подключить действительно просто. Непросто — сделать так, чтобы при десятикратном росте пользователей счёт вырос не в десять раз.
02 · Три схемы подключения
Практическое правило: начинайте с API или шлюза, к self-host переходите по цифрам, а не из принципа. Считать надо на реальном потоке обращений, а он на старте всегда меньше ожидаемого.
03 · Как считать стоимость обращения
Модели тарифицируются в токенах — кусочках текста примерно в 2–4 символа. Платите и за то, что отправили (запрос, инструкция, контекст), и за то, что получили (ответ). Порядок такой:
- Прикиньте размер одного обращения. Типичный диалоговый запрос с ответом — 1500–2000 токенов. Если в запрос кладётся история переписки или описание товара — больше.
- Умножьте на цену выбранной модели. Лёгкие модели — доли копейки за обращение, средние — единицы копеек, самые мощные — рубли. Разброс между «дешёвой» и «топовой» моделью на одной задаче легко достигает 50–100 раз.
- Умножьте на прогноз обращений. Не на число пользователей, а на число обращений: активный пользователь чат-функции делает их десятки в месяц.
- Добавьте медиа. Распознавание фото и генерация картинок считаются отдельно и стоят заметно дороже текста — единицы рублей за операцию.
Пример логики (цифры условные, считайте под свою модель): 2000 обращений в месяц по 2 копейки — это 40 ₽, ерунда. Те же 2000 обращений на топовой модели по 3 ₽ — уже 6000 ₽. А если функция окажется популярной и обращений станет 50 000 — разница между 1000 ₽ и 150 000 ₽ в месяц. Выбор модели — это не про качество, это про экономику продукта.
04 · Когда нейросеть не нужна
Самая дешёвая оптимизация — не использовать большую модель там, где она не нужна:
- Разложить обращения по категориям — классификатор. Обучается на ваших данных, работает мгновенно, стоит копейки на всём объёме.
- Найти похожий товар или ответ из базы — поиск по векторам или обычный полнотекстовый. Языковая модель тут нужна разве что для красивой формулировки.
- Ответить на частый вопрос — готовый ответ из базы знаний. В ботах это закрывает большую часть диалогов вообще без ИИ.
- Проверить формат данных — правила и валидация, а не модель.
Языковая модель оправдана там, где ответ нельзя заранее перечислить: свободный диалог, объяснение, генерация текста под контекст, разбор фотографии. В приложении для садоводов ровно поэтому связка гибридная: распознавание по фото и ИИ-чат там, где нужен разбор ситуации, и простая логика во всём остальном.
05 · Пять способов срезать расход
- Кэш ответов. Одинаковые вопросы задают тысячи людей. Кэш на популярные запросы срезает счёт кратно — мы так делаем и с озвучкой, и с типовыми ответами.
- Каскад моделей. Сначала дешёвая модель, и только если она не справилась — дорогая. На потоке это экономит десятки процентов.
- Короткий контекст. Не отправляйте всю историю переписки в каждом запросе — только релевантное. Контекст — это тоже деньги.
- Лимиты на пользователя. Честные ограничения бесплатного тарифа, считаемые на бэкенде. Это и защита от расхода, и основа монетизации.
- Мониторинг с первого дня. Расход по дням, по функциям и по пользователям — в админке. Иначе аномалию заметите по счёту в конце месяца.
06 · Как закладывать AI в смету
Что мы пишем в смете клиенту, когда в проекте есть ИИ:
- Разработку AI-функции отдельной строкой — 150–400 тыс ₽ в зависимости от сценария (распознавание по фото, чат с оператором, генерация контента).
- Прогноз ежемесячного потребления — с расчётом на ожидаемое число обращений и явно названной моделью.
- Лимиты и кэш — как часть работы, а не «оптимизируем потом».
- Запасную модель — на случай сбоя или скачка цен у провайдера.
И главный вопрос, который стоит задать до разработки: сколько вы готовы платить за одно обращение пользователя? Из ответа выводится и модель, и архитектура, и лимиты. Если функция не окупается даже на бумаге — лучше это выяснить до, а не после.
Хотите посчитать под свою задачу — опишите сценарий и ожидаемый поток. Разберём бесплатно: какая схема дешевле, где хватит классификатора и во сколько обойдётся эксплуатация. Общая структура сметы — в разборе цен на приложение.
07 · Частые вопросы
Сколько стоит одно обращение к нейросети?
Считается от объёма текста: типичный запрос с ответом — 1500–2000 токенов. На лёгких моделях это доли копейки, на средних — единицы копеек, на самых мощных — рубли. Картинки и распознавание фото — дороже, единицы рублей за операцию.
Что дешевле — API или свой сервер?
На старте почти всегда API: платите за использование, без затрат на GPU-сервер. Self-host выигрывает при больших стабильных объёмах или когда данные нельзя отдавать наружу.
Можно ли обойтись без нейросети?
Часто да: категории, поиск похожего, ответы на частые вопросы закрываются классификатором и базой знаний — дешевле в тысячи раз и предсказуемее.
Сколько закладывать в бюджет?
Две строки: разработка функции 150–400 тыс ₽ и ежемесячное потребление по прогнозу обращений. Плюс лимиты и кэш — сразу, а не «потом».