Экономика инференса: почему открытые модели угрожают бизнесу Anthropic

Все привыкли думать, что исход гонки нейросетей решит качество ответов и победы в бенчмарках. Но что, если реального победителя определят банальные счета за электричество и аренду серверов?
Новые релизы Kimi K3 от Moonshot Labs и Qwen 3.8 от Alibaba доказали, что открытые нейросети способны работать на уровне закрытых флагманов. По тестам они вплотную приблизились к лидирующей модели от Anthropic. Правда, за графиками производительности скрывается суровая экономика. Обучить нейросеть дорого, но главная статья расходов — это инференс. Поддержание ежедневной работы требует огромных объемов вычислительных мощностей и энергии.
На рынке сформировалось жесткое разделение. Компании вроде Meta и Alibaba строят собственные дата-центры, превращая переменные затраты на инфраструктуру в фиксированные. SpaceX идет еще дальше, контролируя даже генерацию энергии. А вот Anthropic арендует чужие мощности. Их издержки растут пропорционально количеству пользовательских запросов, поэтому маржинальность не увеличивается вместе с масштабом. Уже сейчас использование флагманской модели Anthropic обходится почти в три раза дороже при выполнении типовых задач.
Чистым разработчикам моделей становится все сложнее защищать свой бизнес. Если у компании нет своей инфраструктуры или мощной экосистемы продуктов, как у OpenAI, единственный шанс выжить — постоянно сохранять недостижимый отрыв в качестве генерации. Но китайские открытые нейросети показывают, что долго удерживать технологическую монополию не выходит. Ставка исключительно на продажу доступа к API без контроля над железом выглядит как путь в никуда.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад