Гонка за скоростью языковых моделей продолжается, и разработчики обещают мгновенную генерацию без потери качества. OpenAI представила режим Ultrafast для GPT-5.6 Sol, который работает на чипах Cerebras и выдает до 750 токенов в секунду. Это в 14 раз быстрее стандартного вывода. Патч кода на 2000 токенов формируется менее чем за три секунды. Весь лимит в 128 тысяч контекста теоретически можно выжечь за пару минут.
Но высокая скорость вывода не всегда означает пропорциональное ускорение рабочих процессов. OpenAI делает ставку на то, что Ultrafast поможет в реагировании на инциденты, саппорте и финансовой аналитике. Разработчики утверждают, что длительные вычисления теперь можно превратить в интерактивную сессию. Правда, в таких сценариях узким горлышком обычно является не генерация текста, а задержки при обращении агента к внешним базам данных и API.
Когда нейросеть выдает сложную аналитику за несколько секунд, инженерам все равно требуется время на ее осмысление. Вопрос в том, имеет ли смысл гнаться за миллисекундами, если на этапе верификации фактов весь выигрыш нивелируется человеческим фактором. Пока режим доступен лишь в закрытом превью, это выглядит скорее как демонстрация сырой вычислительной мощности, чем как массовый рабочий инструмент.
Поделиться:
Как идеальный нарратив отключает фактчекинг: история самого молодого профессора Кембриджа
Почему современные нейросети больше не могут сгенерировать классический мем с Уиллом Смитом и спагетти