Архивный материал. Перенесён без новой редакционной проверки; факты и продуктовые условия относятся к дате исходной публикации.
Каждый раз, когда мы начинаем пилотный ИИ-проект, происходит примерно один и тот же диалог:
- А вот Kimi K3 же бесплатный. Давайте сразу купим серверы, поставим его у себя и перестанем платить за аренду и подписки.
Да, веса модели доступны. Для внутреннего использования лицензия вообще не ставит условий. Они начинаются, только если вы сами продаёте доступ к модели наружу.
Но «веса доступны» и «инференс бесплатный» - разные вещи.
И я не смеюсь над этим вопросом. Обычно человек просто ещё не прикидывал стоимость кластера, эксплуатации и, главное, его реальную загрузку.
Железо само по себе не бесполезная инвестиция. Но его нужно загрузить. Стабильно и экономически оправданно, без «иногда им пользуются двадцать сотрудников»: с понятной нагрузкой, пиками, требованиями к качеству, человеком на поддержку и горизонтом хотя бы в год.
Если тот же объём работы на API или подписках обходится экономически эффективнее аренды GPU, а тем более покупки своего сервера, на стадии пилота рациональнее купить токены.
Пилот нужен, чтобы ответить на другие вопросы:
- Люди вообще будут этим пользоваться?
- На каких задачах система даст вменяемые результаты даёт результат?
- Сколько токенов и контекста реально съедает работа?
- Какой процент запросов повторяется и кэшируется?
- Сколько стоит один полезный рабочий результат, а не миллион токенов в отчёте?
- Есть ли экономический эффект или сотрудник дешевле и эффективнее?
Про кэш отдельно, потому что он может решить всю экономику.
На этой неделе попался разбор на хабре от технаря, который арендовал GPU за 131 тысячу рублей в месяц для шестнадцати активных пользователей. В его профиле нагрузки аренда уже обгоняет старшую подписку: порог оказался около двенадцати активных человек.
Но расчёт против API у него построен на другом числе: 96,9% входных токенов обслуживались локальным prefix cache.
И автор сам честно пишет: переносить эти 96,9% на облако нельзя. Там другой механизм, другое время жизни кэша и отдельная цена за запись.
То есть тот процент, по которому вы собираетесь сравнивать своё с облаком, на двух сторонах может считаться по-разному. Пока вы не измерили его на своей нагрузке и у выбранного провайдера, сравнения нет. Есть два стенда, поставленные рядом.
Двенадцать пользователей здесь не магическое число. Это порог конкретного стенда, конкретной модели и конкретного профиля работы. Но сам принцип важен: железо имеет смысл только после того, как доказана его загрузка.
Для не-ИТ-компании из СНГ собственное железо в большинстве случаев на старте экономически невыгодно Оно начинает иметь смысл, когда совпадают несколько условий: постоянная высокая загрузка, данные нельзя отдавать внешнему провайдеру, понятны модель и профиль нагрузки, есть кому всё это поддерживать.
До этого момента сервер не способ сэкономить. Это дорогая гипотеза, которую можно проверить гораздо дешевле.
Источники и след
- 01 Оригинал в канале Under the Hood Происхождение / Telegram / сообщение 837