Про то, какую модель брать под задачу, мы уже писали. Но есть вопрос, который всплывает позже и бьёт больнее: сколько ИИ стоит в эксплуатации. Разработку оценивают все, а вот счёт, который приходит каждый месяц и растёт вместе с числом пользователей, обычно обнаруживают постфактум.

Эта статья — про деньги: три схемы подключения ИИ, как считать цену одного обращения и что делать, чтобы расход не обгонял выручку.

01 · Две строки бюджета, а не одна

AI в продукте — это всегда две разные статьи расходов:

  • Разработка функции — разовая. Интеграция, промпты и их отладка, обработка ошибок и таймаутов, экраны, лимиты, админка. Обычно 150–400 тыс ₽ сверх базовой сметы приложения, в зависимости от сложности сценария.
  • Потребление моделей — ежемесячная и растущая. Зависит не от вас, а от активности пользователей.
Опасная фраза в проекте: «AI подключим, там же просто API». Подключить действительно просто. Непросто — сделать так, чтобы при десятикратном росте пользователей счёт вырос не в десять раз.

02 · Три схемы подключения

1. Прямое облачное API. Приложение (точнее, ваш бэкенд) ходит в облако провайдера модели. Плюсы: запуск за дни, платите только за использование, всегда свежие модели. Минусы: зависимость от одного поставщика, оплата в валюте, данные уходят наружу. Стартовый вариант по умолчанию.
2. Шлюз-агрегатор (наш выбор в большинстве проектов). Между приложением и моделями стоит один сервис-маршрутизатор, через который доступны десятки моделей разных провайдеров. Можно менять модель на лету, сравнивать цену и качество, держать запасную на случай сбоя. Мы сами так генерируем обложки для этого журнала: одна картинка — порядка трёх-четырёх рублей, модель меняется одной строкой в конфиге.
3. Self-host — модель на своём сервере. Оправдан, когда данные нельзя отдавать наружу (медицина, персональные данные, корпоративные требования) или когда объёмы стабильно большие и фиксированная аренда сервера с видеокартой выходит дешевле поштучной оплаты. Мы разворачивали AI-платформу на инфраструктуре клиента — это рабочий путь, но он требует сервера и сопровождения.

Практическое правило: начинайте с API или шлюза, к self-host переходите по цифрам, а не из принципа. Считать надо на реальном потоке обращений, а он на старте всегда меньше ожидаемого.

03 · Как считать стоимость обращения

Модели тарифицируются в токенах — кусочках текста примерно в 2–4 символа. Платите и за то, что отправили (запрос, инструкция, контекст), и за то, что получили (ответ). Порядок такой:

  1. Прикиньте размер одного обращения. Типичный диалоговый запрос с ответом — 1500–2000 токенов. Если в запрос кладётся история переписки или описание товара — больше.
  2. Умножьте на цену выбранной модели. Лёгкие модели — доли копейки за обращение, средние — единицы копеек, самые мощные — рубли. Разброс между «дешёвой» и «топовой» моделью на одной задаче легко достигает 50–100 раз.
  3. Умножьте на прогноз обращений. Не на число пользователей, а на число обращений: активный пользователь чат-функции делает их десятки в месяц.
  4. Добавьте медиа. Распознавание фото и генерация картинок считаются отдельно и стоят заметно дороже текста — единицы рублей за операцию.

Пример логики (цифры условные, считайте под свою модель): 2000 обращений в месяц по 2 копейки — это 40 ₽, ерунда. Те же 2000 обращений на топовой модели по 3 ₽ — уже 6000 ₽. А если функция окажется популярной и обращений станет 50 000 — разница между 1000 ₽ и 150 000 ₽ в месяц. Выбор модели — это не про качество, это про экономику продукта.

04 · Когда нейросеть не нужна

Самая дешёвая оптимизация — не использовать большую модель там, где она не нужна:

  • Разложить обращения по категориям — классификатор. Обучается на ваших данных, работает мгновенно, стоит копейки на всём объёме.
  • Найти похожий товар или ответ из базы — поиск по векторам или обычный полнотекстовый. Языковая модель тут нужна разве что для красивой формулировки.
  • Ответить на частый вопрос — готовый ответ из базы знаний. В ботах это закрывает большую часть диалогов вообще без ИИ.
  • Проверить формат данных — правила и валидация, а не модель.

Языковая модель оправдана там, где ответ нельзя заранее перечислить: свободный диалог, объяснение, генерация текста под контекст, разбор фотографии. В приложении для садоводов ровно поэтому связка гибридная: распознавание по фото и ИИ-чат там, где нужен разбор ситуации, и простая логика во всём остальном.

05 · Пять способов срезать расход

  • Кэш ответов. Одинаковые вопросы задают тысячи людей. Кэш на популярные запросы срезает счёт кратно — мы так делаем и с озвучкой, и с типовыми ответами.
  • Каскад моделей. Сначала дешёвая модель, и только если она не справилась — дорогая. На потоке это экономит десятки процентов.
  • Короткий контекст. Не отправляйте всю историю переписки в каждом запросе — только релевантное. Контекст — это тоже деньги.
  • Лимиты на пользователя. Честные ограничения бесплатного тарифа, считаемые на бэкенде. Это и защита от расхода, и основа монетизации.
  • Мониторинг с первого дня. Расход по дням, по функциям и по пользователям — в админке. Иначе аномалию заметите по счёту в конце месяца.

06 · Как закладывать AI в смету

Что мы пишем в смете клиенту, когда в проекте есть ИИ:

  1. Разработку AI-функции отдельной строкой — 150–400 тыс ₽ в зависимости от сценария (распознавание по фото, чат с оператором, генерация контента).
  2. Прогноз ежемесячного потребления — с расчётом на ожидаемое число обращений и явно названной моделью.
  3. Лимиты и кэш — как часть работы, а не «оптимизируем потом».
  4. Запасную модель — на случай сбоя или скачка цен у провайдера.

И главный вопрос, который стоит задать до разработки: сколько вы готовы платить за одно обращение пользователя? Из ответа выводится и модель, и архитектура, и лимиты. Если функция не окупается даже на бумаге — лучше это выяснить до, а не после.

Хотите посчитать под свою задачу — опишите сценарий и ожидаемый поток. Разберём бесплатно: какая схема дешевле, где хватит классификатора и во сколько обойдётся эксплуатация. Общая структура сметы — в разборе цен на приложение.

07 · Частые вопросы

Сколько стоит одно обращение к нейросети?
Считается от объёма текста: типичный запрос с ответом — 1500–2000 токенов. На лёгких моделях это доли копейки, на средних — единицы копеек, на самых мощных — рубли. Картинки и распознавание фото — дороже, единицы рублей за операцию.

Что дешевле — API или свой сервер?
На старте почти всегда API: платите за использование, без затрат на GPU-сервер. Self-host выигрывает при больших стабильных объёмах или когда данные нельзя отдавать наружу.

Можно ли обойтись без нейросети?
Часто да: категории, поиск похожего, ответы на частые вопросы закрываются классификатором и базой знаний — дешевле в тысячи раз и предсказуемее.

Сколько закладывать в бюджет?
Две строки: разработка функции 150–400 тыс ₽ и ежемесячное потребление по прогнозу обращений. Плюс лимиты и кэш — сразу, а не «потом».