← Назад в блог

Экономика ИИ-инфраструктуры · 18 июля 2026 г.

Покупать токены, арендовать GPU или купить свою? Считаем inference солопренера

OpenRouter, прямые API OpenAI, Anthropic и Gemini, арендованные GPU и машина под столом оптимизируют разные вещи. Цена токена — только одна ось; реальный выбор определяют utilisation, качество, privacy, rate limits и время оператора.

15 мин чтенияДокументированоСмоделировано

Методика

Что именно сравнивается

  1. Разделяем input, output, cache-write, cache-read, request, image и reasoning-token meters.
  2. Сравниваем комиссию OpenRouter с прямым list price и не притворяемся, что модели с разными именами одинаковы по качеству.
  3. Арендованные и собственные GPU моделируем для open-weight моделей класса 8B–14B, а не для закрытых frontier models.
  4. Амортизируем своё железо за 36 месяцев и показываем electricity, utilisation, failures и operator time как заменяемые предположения.

Это четыре разных покупки

Прямой model API покупает конкретную модель провайдера, его rate limits, правила данных и биллинг. OpenRouter покупает один API, общий баланс, routing, fallbacks и широкий каталог. Арендованная GPU покупает machine time. Своя GPU — амортизируемую мощность, электричество, тепло и очередь эксплуатации.

OpenRouter сейчас передаёт provider list price и берёт 5.5% при покупке кредитов с минимумом $0.80. У BYOK отдельная квота и fee policy. Бесплатные модели имеют строгие суточные лимиты и не являются production capacity plan.[1][2]

Прямые провайдеры по-разному считают caching, batch, context и rate tiers. Anthropic, например, включает повышенную long-context ставку после документированного input threshold и даёт 50% скидку Batch API. Самая дешёвая headline-модель становится дорогой, если доминируют output или uncached context.[5]

За что вы платите в каждом варианте
ПутьПеременная единицаЭксплуатационная нагрузкаГлавная денежная ловушка
OpenRouterProvider usage и комиссия пополненияНизкаяAuto top-up, provider routing, неиспользованные кредиты
Прямой APIТокены, запросы, toolsНизкаяOutput и long-context multipliers, рост rate tier
Арендованная GPUGPU seconds, storage, networkСредняяIdle worker, cold starts, оставшиеся volumes
Своя GPUЖелезо, электричество, операторВысокаяНизкий utilisation и неподходящие model/VRAM

Первая оптимизация — учёт, а не железо

Считайте цену продуктового действия: один ответ поддержки, одно извлечение документа, одно изображение, одна завершённая задача агента. Сумма токенов без результата пользователя создаёт видимость эффективного routing при неэкономичном продукте.

OpenRouter показывает usage по провайдеру, модели и ключу, а также актуальный кредитный баланс. Прямые OpenAI и Anthropic API возвращают usage fields, которые стоит хранить рядом с latency запроса, errors, retries и ID продуктовой операции.[2][3][4][5]

Цена $1,000 upstream inferenceТолько отношение комиссий. Без налогов, договорных скидок, failed retries и различий качества. Для небольших пополнений minimum fee OpenRouter важнее процента.
Цена $1,000 upstream inferenceТолько отношение комиссий. Без налогов, договорных скидок, failed retries и различий качества. Для небольших пополнений minimum fee OpenRouter важнее процента.Прямой провайдер$1,000Базовый list price провайдераКредиты OpenRouter$1,0555.5% комиссии пополнения по опубликованной ставкеOpenRouter BYOK в квоте$1,000В документированной free allowance; usage всё равно оплачивается провайдеруUSD
Расчётный месячный inference envelopeAPI-линии представляют платный класс моделей; GPU-линии — открытую 8B–14B модель и не равны по качеству. График показывает, почему utilisation является решающей переменной.
Расчётный месячный inference envelopeAPI-линии представляют платный класс моделей; GPU-линии — открытую 8B–14B модель и не равны по качеству. График показывает, почему utilisation является решающей переменной.

Break-even GPU — в основном график utilisation

Runpod публикует почасовые цены GPU от небольших 24 GB карт до 96 GB и datacenter GPU. RTX 5090 можно арендовать по часам, а serverless workers берут более высокую active rate за эластичность. Persistent storage и idle pod time всё равно требуют явного teardown.[7]

Локальная RTX 5090 имеет 32 ГБ памяти, 575 Вт total graphics power и требует систему примерно на 1000 Вт. Профессиональная RTX PRO 6000 имеет 96 ГБ ECC и максимум 600 Вт. VRAM определяет, какая модель и batch помещаются, раньше номинальной скорости compute.[8][9]

При $0.20/кВт⋅ч система на 700 Вт, работающая постоянно, стоит около $102/месяц до охлаждения. Добавьте трёхлетнюю амортизацию, downtime, сеть и время основателя. При 10% полезного utilisation большая часть fixed cost производит тепло, а не токены.

Месячный fixed envelope своей RTX 5090Модель рабочей станции за $3,600 на 36 месяцев, электричества по $0.20/кВт⋅ч и небольшого maintenance. Замените каждое предположение для своей страны и сборки.
Месячный fixed envelope своей RTX 5090Модель рабочей станции за $3,600 на 36 месяцев, электричества по $0.20/кВт⋅ч и небольшого maintenance. Замените каждое предположение для своей страны и сборки.Амортизация железа$100Электричество за полный месяц$102Резерв на обслуживание$25Сеть и удалённый доступ$10USD/месяц

Покупайте по стадиям

Начните с прямого API, если один провайдер и одна модель способны проверить продукт. Добавляйте OpenRouter, когда routing, fallback, общий учёт или быстрые эксперименты с моделями стоят комиссии. Для privacy-sensitive запросов фиксируйте provider selection явно.

Арендуйте GPU после того, как open model прошла реальную оценку и почасовой спрос измерен. Покупайте железо только при стабильно высокой загрузке аренды, подходящем VRAM и приемлемом fallback на время простоя.

  • Прототип: один прямой API, prepaid budget где возможно, cost telemetry по функциям.
  • Multi-model продукт: gateway или OpenRouter с per-key limits и privacy-aware routing.
  • Стабильный спрос на open model: арендованная GPU с autoscaling и бюджетом retained volume.
  • Постоянный private inference: своё железо, cloud fallback и проверенный recovery path.

Реестр источников

Спецификации и цены меняются. Ссылки делают снимок проверяемым.

Источники и коммерческие данные проверены 2026-07-18. Если источник не говорит обратного, цены указаны без налогов.

  1. OpenRouter pricingOpenRouter · цены
  2. Pricing, privacy, and credit FAQOpenRouter · биллинг
  3. API usage limitsOpenRouter · биллинг
  4. OpenAI API pricingOpenAI · цены
  5. Claude API pricingAnthropic · цены
  6. Gemini Developer API pricingGoogle · цены
  7. GPU Cloud pricingRunpod · цены
  8. GeForce RTX 5090 specificationsNVIDIA · продукт
  9. RTX PRO 6000 Blackwell specificationsNVIDIA · продукт