
Режиссура синтетических голосов, бургеры за миллиард и вековой архив
Шесть коротких сюжетов о том, куда уходят рекламные бюджеты и как меняется ремесло визуала
Деньги в медиа продолжают перетекать в неожиданные места: экраны для заказа фастфуда становятся рекламной площадкой с миллиардным потенциалом, а в кодовой базе ChatGPT находят ценник в пятьсот долларов за доступ. Инструменты тем временем отказываются от лишней магии в пользу чистого контроля — LaunchVideo генерирует коммерческий моушн прямо из веб-верстки без непредсказуемой диффузии.
В звуке и 3D сдвиги не менее осязаемые: новая Gemini научилась понимать актерские ремарки в скобках и шептать по сценарию, Agora-2 строит интерактивные пространства на двадцать пользователей, а университет Аалто выложил в общий доступ сотню лет безупречной графики и мебели. Собрали главное за сегодня — плотно и без воды.
LaunchVideo собирает проморолики из веб-страниц без диффузионных нейросетей

Вместо десятков промптов в генераторах видео — одна ссылка на сайт продукта или короткий бриф. Новый веб-сервис LaunchVideo выкачивает контент лендинга и превращает его в готовое презентационное видео за один прогон, обходясь без традиционных диффузионных моделей. Процесс рендеринга занимает около четырёх минут, выдавая стандартный MP4-файл в разрешении 1920x1080 при 30 кадрах в секунду. Промежуточных правок вручную сервис не предусматривает.
Инженерия браузерного рендера
Технически проект опирается на агентный шаблон OpenComputer и модель Claude Opus 5.5. Архитектура работает без привычных нейросетевых видеогенераторов: большая языковая модель пишет сценарий и код анимаций, а серверный агент детерминированно переводит верстку в видеоряд. На весь пайплайн уходит порядка 100 000 токенов — примерно 90 000 входных и 15 000 выходных, львиная доля которых уходит на сборку сложного HTML-кода.
Каждый запуск разворачивается в изолированной среде:
- Рантайм: микровиртуальная машина на базе Amazon Linux 2023 (архитектура arm64, 4 vCPU, 8 ГБ оперативной памяти и Node.js 22). Около минуты уходит на установку связки из Playwright с браузером Chromium и статического ffmpeg, а после экспорта машина уничтожается.
- Набор инструментов: агент использует три системные функции.
web_fetchчитает сайт, забирая заголовки, текстовые блоки, HEX-коды палитры и шрифты из Google Fonts. Инструментcheck_sceneподнимает сгенерированную страницу, ищет ошибки JavaScript и сверяет видимый текст по временным засечкам. Финал закрываетrender_video. - Запись кадров: стандартное системное время браузера — вызовы Date, requestAnimationFrame, таймеры, CSS-анимации и Web Animations API — подменяются виртуальными часами. Браузер с абсолютной точностью сменяет кадры, сохраняет их в JPEG и передаёт кодеку libx264 со значением CRF 18.
- Безопасность: ключи доступа внутри не хранятся. Веб-интерфейс генерирует токен загрузки в Vercel Blob с трёхчасовым сроком жизни под конкретный путь, откуда готовый файл отдаётся по публичному адресу.
Исходный код агентского сценария на TypeScript опубликован в репозитории diggerhq/shipvideo на GitHub и запускается в один клик. Концепция выросла из заметок Диди Даса (Deedy Das) об использовании Opus 5.5 для создания обучающих роликов через программный рендеринг веб-разметки. Пожалуй, для рекламного продакшена это сигнал: генерация моушна смещается от непредсказуемой диффузии к строгому коду, где типографика не плывёт, а фирменные цвета берутся прямиком из CSS.
McDonald's превращает экраны заказов в рекламную сеть на миллиард долларов

Пока посетитель выбирает бургер на тачскрине, рядом с картошкой фри появляется баннер сторонней компании. McDonald's решил превратить торговые залы в медиаплощадку: сеть запустила пилот собственной коммерческой рекламной сети в 450 собственных ресторанах на территории США. Точки франчайзи в эксперимент пока не вошли — технологию обкатывают исключительно на корпоративных локациях.
Чужие бренды теперь размещаются на привычных поверхностях фастфуд-гиганта:
- экранах терминалов самообслуживания;
- дисплеях зоны выдачи заказов;
- фирменном мобильном приложении и остальных цифровых каналах сети.

Запустить такой инвентарь позволила масштабная перестройка систем: компания связала в единый контур терминалы заказов, программу лояльности, маркетинг и пользовательские данные. Охваты у витрины колоссальные: ежедневно McDonald's обслуживает более 70 миллионов клиентов по всему миру, а около 85% жителей США заходят в рестораны хотя бы раз в год. По словам главы маркетинга сети Морган Флэтли, компания видит в собственном медиабизнесе потенциал на несколько миллиардов. Ближайшая планка — достичь 1 миллиарда долларов рекламной выручки, правда, точных дедлайнов руководство сети пока не называет.
Для креативных агентств и моушн-дизайнеров открывается совершенно непривычный носитель — экраны импульсивного выбора с максимальной концентрацией внимания. Похоже, скоро нам придется учиться верстать продуктовые интеграции под интерфейсы терминалов, где главный конкурент креатива за взгляд зрителя — кнопка добавления сырного соуса.
Google выпустил Gemini 3.8 TTS с режиссурой актерских ремарок и диалогами

Персонаж вздыхает посреди реплики, тихо усмехается и перебивает собеседника на полуслове — теперь это не ручная сборка дорожки в аудиоредакторе, а текстовый промпт. Google выкатил линейку Gemini 3.8 TTS, заточенную под озвучку с живым характером. Вместо стерильного дикторского бубнежа модели скормили нюансы актерской игры: паузы, смех, вздохи и междометия вроде «ага» или «угу». Система понимает обычные режиссерские ремарки прямо в сценарии, меняя подачу сцены на лету, и способна вести нативный диалог между двумя спикерами без распада тембра на дистанции в несколько часов.
Что внутри линейки
Семейство разделили под две разные задачи:
- Gemini 3.8 Flash TTS — инструмент для арта, анимации и проработки сложных игровых характеров, где важна тонкая нюансировка.
- Gemini 3.8 Flash-Lite TTS — экономный вариант для тяжелых объемов контента, когда нужно озвучить гигабайты текста с минимальными затратами.

В библиотеку зашили больше 2000 готовых голосов на 100 с лишним языках и диалектах — от квебекского французского и мексиканского испанского до шотландского английского. Клонирование тембра требует аудиосэмпл длиной всего в 30 секунд. Правда, ради безопасности процесс сопроводили обязательной проверкой согласия автора голоса и защитой скрытым водяным знаком SynthID. Скоро обещают добавить инструмент ремикса, чтобы крутить высоту, темп и акценты как эквалайзер.

В тестах модели забрали верхние строчки. В Hume AI Voice Design система лидирует с баллом 71.4 и держит 60.8 за акценты, а Flash и Flash-Lite заняли первое и второе места в Hume AI Overall Quality. В Voice Arena нейросеть обошла конкурентов на японском, арабском, хинди, вьетнамском, мексиканском испанском и бразильском португальском. Правда, географию клонирования пока урезали: функция недоступна в Евросоюзе, Великобритании, Швейцарии, Индии, а также в американских штатах Иллинойс и Техас.

Для моушн-дизайнеров и инди-аниматоров это меняет механику черновой озвучки. Собрать диалоговый аниматик с правдоподобными актерскими интонациями теперь можно прямо на этапе раскадровки, не дожидаясь записи живых актеров.
Университет Аалто выложил в открытый доступ вековой архив скандинавского дизайна

Лекционные диапозитивы Кая Франка о законах композиции и рукотворные чертежи Алвара Аалто теперь можно рассмотреть в деталях прямо в браузере. Университет Аалто запустил публичный цифровой портал Aalto Repository. Архитектурная база, которую десятилетиями копили финские мастерские, превратилась в открытую систему долгосрочного хранения: за техническую сторону отвечает платформа Preservica, а за сохранность фондов — подразделение Aalto University Archives.
Каталог разбит на пять базовых разделов: учебные материалы (Opetusaineistot), студенческие проекты (Oppilastyöt), частные фонды (Yksityisarkistot), персональные архивы (Henkilöarkistot), а также художественные и музейные коллекции (Taide- ja museokokoelmat). Внутри собраны пласты визуальной культуры с начала прошлого века:
- Чертежи и проектная графика архитекторов — от Алвара Аалто и Йохана Жака Аренберга до Харри Мойланена и Хельмириитты Хонканен;
- Дипломные проекты и графические приложения архитектурного факультета и градостроительного отделения за период с 1905 по 1953 год;
- Исследования по истории декоративного искусства, орнаментике и архитектурным обмерам;
- Практические работы студентов отделений керамики и художественного стекла;
- Ботанические иллюстрации Digi-Botanica, фонды отдела геодезии (Maanmittausosasto) и ландшафтной архитектуры;
- Документы лаборатории низких температур (Low Temperature Laboratory) и экономического факультета (Kauppatieteellinen ala).
Интерфейс не заставляет листать всё подряд: искать исходники можно по ключевым словам с логическими операторами AND, OR, NOT и маскированием через звездочку (*), либо вручную через каталог коллекций. Каждый файл сопровождается паспортом с датой, автором и правилами цитирования. Объекты распространяются под лицензиями Creative Commons либо со статусом Rightsstatements InC-EDU — он защищает копирайт, но разрешает образовательное использование. Единственное железное требование ко всем, кто берет графику в работу, — указывать авторов, тип лицензии и ссылку на репозиторий как первоисточник.
Для дизайнеров и арт-директоров это редкий шанс залезть под капот северного модернизма без посредников и стоковых фильтров. Нас подкупило, что проектная кухня финских школ теперь доступна в один клик — чистое сырье для ресерча и типографических экспериментов.
Модель Agora-2 научилась собирать интерактивные миры для двадцати игроков

Двадцать персонажей бродят по изометрическому подземелью, огибают стены и реагируют на действия соседей — только за физику и геометрию здесь отвечает не классический движок, а нейросеть. Компания Odyssey представила Agora-2, обновленную модель мира для генерации интерактивных пространств в реальном времени. Если первая версия системы Agora-1 справлялась лишь с одиночными сценами для небольшой группы, то здесь планку подняли сразу в пять раз: симуляция теперь удерживает до 20 участников одновременно, распределяя нагрузку между живыми людьми и ИИ-агентами сразу в нескольких параллельных средах.
Базой для тренировки послужили геймплейные записи Diablo II от Blizzard. Разработчики скормили модели массивы наблюдений, действий и состояний, превратив алгоритм в обучаемый движок со строгим разделением ролей:
- Симуляционный сервер прогнозирует общее состояние мира через механизм внимания, удерживая свойства объектов, геометрию локаций и недавние шаги участников.
- Свойства сущностей сохраняются в памяти вне зависимости от ракурса камеры: если отвернуться от персонажа, он не исчезнет и не потребует повторной генерации при возвращении взгляда.
- Модель рендеринга на основе согласования потоков (flow matching) собирает персональный поток пикселей из сжатого представления, учитывая разный уровень визуального шума.
- Непрерывный цикл обратной связи превращает каждый свежий кадр в визуальную историю для следующего шага симуляции.

Поведение самих агентов шлифовали обучением с подкреплением при частично открытой карте: они умеют преследовать противников, обходить препятствия и выбираться из тупиков. Их соперничество формирует автоматические учебные программы, которые Odyssey планирует внедрять в свои фундаментальные модели вроде Odyssey-3. Список применений выходит далеко за рамки видеоигр: авторы метят в робототехнику, беспилотный транспорт, оборонные системы, энергетику и кибербезопасность — вплоть до защиты от сговора автономных агентов и отражения сетевых атак.

Нас в этой истории подкупает смена производственной логики: интерактивное окружение больше не обязательно собирать руками из полигонов, разверток и шейдеров. Для моушн-дизайнеров и авторов виртуального продакшена это редкая возможность увидеть генерацию трехмерной логики прямо из сырых пикселей — игровая превью-версия и технический отчет уже выложены в открытый доступ. Пожалуй, традиционным рендерам пора готовиться к очень непривычному соседству.
В интерфейсе ChatGPT обнаружили подписку Pro Max за 500 долларов в месяц

Датамайнеры залезли в код фронтенда ChatGPT и наткнулись на строчку, от которой вздрогнет продюсер любого небольшого продакшена: тариф Pro Max с ценником 500 долларов в месяц. Без учета налогов. В странах с НДС финальный чек составит около 600 долларов. Находку в конфигурациях сделали аккурат за пять дней до вторничной конференции DevDay, запланированной на 29 сентября, хотя сама компания релиз пока не комментирует.
Судя по утечке, новый тариф метят в долгие расчеты с ИИ-агентами и масштабную разработку. В коде уже прописан слоган — «Fastest Work + Fastest Codex». Точные лимиты запросов пока не ясны, но ускорение планируют серьезное: пользователи обсуждают вероятное подключение серверных мощностей Cerebras. Картинка складывается занятная, особенно с учетом того, что OpenAI недавно заморозила оформление текущего плана Pro за 200 долларов. Серверные ресурсы, похоже, просто перетасовывают под более дорогой уровень, который обойдется в два с половиной раза дороже прежнего максимума.
По-нашему, для арт-директоров и студийных техдиров пять сотен долларов перестают быть безумием в тот момент, когда генеративные пайплайны встают на конвейер. Обычные лимиты сгорают к обеду, если повесить на агентов автоматическую сборку сцен, скрипты для пакетов графики или сортировку массивов ассетов. За скорость и непрерывность процессов всегда платили сполна — теперь просто сменился адресат платежки.





