Экономика ИИ-инфраструктуры · 18 июля 2026 г.
Покупать токены, арендовать GPU или купить свою? Считаем inference солопренера
OpenRouter, прямые API OpenAI, Anthropic и Gemini, арендованные GPU и машина под столом оптимизируют разные вещи. Цена токена — только одна ось; реальный выбор определяют utilisation, качество, privacy, rate limits и время оператора.
Методика
Что именно сравнивается
- Разделяем input, output, cache-write, cache-read, request, image и reasoning-token meters.
- Сравниваем комиссию OpenRouter с прямым list price и не притворяемся, что модели с разными именами одинаковы по качеству.
- Арендованные и собственные GPU моделируем для open-weight моделей класса 8B–14B, а не для закрытых frontier models.
- Амортизируем своё железо за 36 месяцев и показываем electricity, utilisation, failures и operator time как заменяемые предположения.
Это четыре разных покупки
Прямой model API покупает конкретную модель провайдера, его rate limits, правила данных и биллинг. OpenRouter покупает один API, общий баланс, routing, fallbacks и широкий каталог. Арендованная GPU покупает machine time. Своя GPU — амортизируемую мощность, электричество, тепло и очередь эксплуатации.
OpenRouter сейчас передаёт provider list price и берёт 5.5% при покупке кредитов с минимумом $0.80. У BYOK отдельная квота и fee policy. Бесплатные модели имеют строгие суточные лимиты и не являются production capacity plan.[1][2]
Прямые провайдеры по-разному считают caching, batch, context и rate tiers. Anthropic, например, включает повышенную long-context ставку после документированного input threshold и даёт 50% скидку Batch API. Самая дешёвая headline-модель становится дорогой, если доминируют output или uncached context.[5]
| Путь | Переменная единица | Эксплуатационная нагрузка | Главная денежная ловушка |
|---|---|---|---|
| OpenRouter | Provider usage и комиссия пополнения | Низкая | Auto top-up, provider routing, неиспользованные кредиты |
| Прямой API | Токены, запросы, tools | Низкая | Output и long-context multipliers, рост rate tier |
| Арендованная GPU | GPU seconds, storage, network | Средняя | Idle worker, cold starts, оставшиеся volumes |
| Своя GPU | Железо, электричество, оператор | Высокая | Низкий utilisation и неподходящие model/VRAM |
Первая оптимизация — учёт, а не железо
Считайте цену продуктового действия: один ответ поддержки, одно извлечение документа, одно изображение, одна завершённая задача агента. Сумма токенов без результата пользователя создаёт видимость эффективного routing при неэкономичном продукте.
OpenRouter показывает usage по провайдеру, модели и ключу, а также актуальный кредитный баланс. Прямые OpenAI и Anthropic API возвращают usage fields, которые стоит хранить рядом с latency запроса, errors, retries и ID продуктовой операции.[2][3][4][5]
Break-even GPU — в основном график utilisation
Runpod публикует почасовые цены GPU от небольших 24 GB карт до 96 GB и datacenter GPU. RTX 5090 можно арендовать по часам, а serverless workers берут более высокую active rate за эластичность. Persistent storage и idle pod time всё равно требуют явного teardown.[7]
Локальная RTX 5090 имеет 32 ГБ памяти, 575 Вт total graphics power и требует систему примерно на 1000 Вт. Профессиональная RTX PRO 6000 имеет 96 ГБ ECC и максимум 600 Вт. VRAM определяет, какая модель и batch помещаются, раньше номинальной скорости compute.[8][9]
При $0.20/кВт⋅ч система на 700 Вт, работающая постоянно, стоит около $102/месяц до охлаждения. Добавьте трёхлетнюю амортизацию, downtime, сеть и время основателя. При 10% полезного utilisation большая часть fixed cost производит тепло, а не токены.
Покупайте по стадиям
Начните с прямого API, если один провайдер и одна модель способны проверить продукт. Добавляйте OpenRouter, когда routing, fallback, общий учёт или быстрые эксперименты с моделями стоят комиссии. Для privacy-sensitive запросов фиксируйте provider selection явно.
Арендуйте GPU после того, как open model прошла реальную оценку и почасовой спрос измерен. Покупайте железо только при стабильно высокой загрузке аренды, подходящем VRAM и приемлемом fallback на время простоя.
- Прототип: один прямой API, prepaid budget где возможно, cost telemetry по функциям.
- Multi-model продукт: gateway или OpenRouter с per-key limits и privacy-aware routing.
- Стабильный спрос на open model: арендованная GPU с autoscaling и бюджетом retained volume.
- Постоянный private inference: своё железо, cloud fallback и проверенный recovery path.
Реестр источников
Спецификации и цены меняются. Ссылки делают снимок проверяемым.
Источники и коммерческие данные проверены 2026-07-18. Если источник не говорит обратного, цены указаны без налогов.
- OpenRouter pricing ↗OpenRouter · цены
- Pricing, privacy, and credit FAQ ↗OpenRouter · биллинг
- API usage limits ↗OpenRouter · биллинг
- OpenAI API pricing ↗OpenAI · цены
- Claude API pricing ↗Anthropic · цены
- Gemini Developer API pricing ↗Google · цены
- GPU Cloud pricing ↗Runpod · цены
- GeForce RTX 5090 specifications ↗NVIDIA · продукт
- RTX PRO 6000 Blackwell specifications ↗NVIDIA · продукт