Статус материала

Архивный материал. Перенесён без новой редакционной проверки; факты и продуктовые условия относятся к дате исходной публикации.

Каждый раз, когда мы начинаем пилотный ИИ-проект, происходит примерно один и тот же диалог:

  • А вот Kimi K3 же бесплатный. Давайте сразу купим серверы, поставим его у себя и перестанем платить за аренду и подписки.

Да, веса модели доступны. Для внутреннего использования лицензия вообще не ставит условий. Они начинаются, только если вы сами продаёте доступ к модели наружу.

Но «веса доступны» и «инференс бесплатный» - разные вещи.

И я не смеюсь над этим вопросом. Обычно человек просто ещё не прикидывал стоимость кластера, эксплуатации и, главное, его реальную загрузку.

Железо само по себе не бесполезная инвестиция. Но его нужно загрузить. Стабильно и экономически оправданно, без «иногда им пользуются двадцать сотрудников»: с понятной нагрузкой, пиками, требованиями к качеству, человеком на поддержку и горизонтом хотя бы в год.

Если тот же объём работы на API или подписках обходится экономически эффективнее аренды GPU, а тем более покупки своего сервера, на стадии пилота рациональнее купить токены.

Пилот нужен, чтобы ответить на другие вопросы:

  • Люди вообще будут этим пользоваться?
  • На каких задачах система даст вменяемые результаты даёт результат?
  • Сколько токенов и контекста реально съедает работа?
  • Какой процент запросов повторяется и кэшируется?
  • Сколько стоит один полезный рабочий результат, а не миллион токенов в отчёте?
  • Есть ли экономический эффект или сотрудник дешевле и эффективнее?

Про кэш отдельно, потому что он может решить всю экономику.

На этой неделе попался разбор на хабре от технаря, который арендовал GPU за 131 тысячу рублей в месяц для шестнадцати активных пользователей. В его профиле нагрузки аренда уже обгоняет старшую подписку: порог оказался около двенадцати активных человек.

Но расчёт против API у него построен на другом числе: 96,9% входных токенов обслуживались локальным prefix cache.

И автор сам честно пишет: переносить эти 96,9% на облако нельзя. Там другой механизм, другое время жизни кэша и отдельная цена за запись.

То есть тот процент, по которому вы собираетесь сравнивать своё с облаком, на двух сторонах может считаться по-разному. Пока вы не измерили его на своей нагрузке и у выбранного провайдера, сравнения нет. Есть два стенда, поставленные рядом.

Двенадцать пользователей здесь не магическое число. Это порог конкретного стенда, конкретной модели и конкретного профиля работы. Но сам принцип важен: железо имеет смысл только после того, как доказана его загрузка.

Для не-ИТ-компании из СНГ собственное железо в большинстве случаев на старте экономически невыгодно Оно начинает иметь смысл, когда совпадают несколько условий: постоянная высокая загрузка, данные нельзя отдавать внешнему провайдеру, понятны модель и профиль нагрузки, есть кому всё это поддерживать.

До этого момента сервер не способ сэкономить. Это дорогая гипотеза, которую можно проверить гораздо дешевле.

Источники и след

  1. 01 Оригинал в канале Under the Hood Происхождение / Telegram / сообщение 837