Фото: Odyssey

Дневной рекап

Режиссура синтетических голосов, бургеры за миллиард и вековой архив

Шесть коротких сюжетов о том, куда уходят рекламные бюджеты и как меняется ремесло визуала

Деньги в медиа продолжают перетекать в неожиданные места: экраны для заказа фастфуда становятся рекламной площадкой с миллиардным потенциалом, а в кодовой базе ChatGPT находят ценник в пятьсот долларов за доступ. Инструменты тем временем отказываются от лишней магии в пользу чистого контроля — LaunchVideo генерирует коммерческий моушн прямо из веб-верстки без непредсказуемой диффузии.

В звуке и 3D сдвиги не менее осязаемые: новая Gemini научилась понимать актерские ремарки в скобках и шептать по сценарию, Agora-2 строит интерактивные пространства на двадцать пользователей, а университет Аалто выложил в общий доступ сотню лет безупречной графики и мебели. Собрали главное за сегодня — плотно и без воды.

LaunchVideo собирает проморолики из веб-страниц без диффузионных нейросетей

The image is a screenshot of the OpenComputer website. The website has a green background and features white text that reads "OpenComputer" in a large, bold font. Below the title, a smaller line of text reads "The background agent cloud." The website also includes a navigation bar with the text "OPENCOMPUTER" at the to
Фото: GitHub

Вместо десятков промптов в генераторах видео — одна ссылка на сайт продукта или короткий бриф. Новый веб-сервис LaunchVideo выкачивает контент лендинга и превращает его в готовое презентационное видео за один прогон, обходясь без традиционных диффузионных моделей. Процесс рендеринга занимает около четырёх минут, выдавая стандартный MP4-файл в разрешении 1920x1080 при 30 кадрах в секунду. Промежуточных правок вручную сервис не предусматривает.

Инженерия браузерного рендера

Технически проект опирается на агентный шаблон OpenComputer и модель Claude Opus 5.5. Архитектура работает без привычных нейросетевых видеогенераторов: большая языковая модель пишет сценарий и код анимаций, а серверный агент детерминированно переводит верстку в видеоряд. На весь пайплайн уходит порядка 100 000 токенов — примерно 90 000 входных и 15 000 выходных, львиная доля которых уходит на сборку сложного HTML-кода.

Каждый запуск разворачивается в изолированной среде:

  • Рантайм: микровиртуальная машина на базе Amazon Linux 2023 (архитектура arm64, 4 vCPU, 8 ГБ оперативной памяти и Node.js 22). Около минуты уходит на установку связки из Playwright с браузером Chromium и статического ffmpeg, а после экспорта машина уничтожается.
  • Набор инструментов: агент использует три системные функции. web_fetch читает сайт, забирая заголовки, текстовые блоки, HEX-коды палитры и шрифты из Google Fonts. Инструмент check_scene поднимает сгенерированную страницу, ищет ошибки JavaScript и сверяет видимый текст по временным засечкам. Финал закрывает render_video.
  • Запись кадров: стандартное системное время браузера — вызовы Date, requestAnimationFrame, таймеры, CSS-анимации и Web Animations API — подменяются виртуальными часами. Браузер с абсолютной точностью сменяет кадры, сохраняет их в JPEG и передаёт кодеку libx264 со значением CRF 18.
  • Безопасность: ключи доступа внутри не хранятся. Веб-интерфейс генерирует токен загрузки в Vercel Blob с трёхчасовым сроком жизни под конкретный путь, откуда готовый файл отдаётся по публичному адресу.

Исходный код агентского сценария на TypeScript опубликован в репозитории diggerhq/shipvideo на GitHub и запускается в один клик. Концепция выросла из заметок Диди Даса (Deedy Das) об использовании Opus 5.5 для создания обучающих роликов через программный рендеринг веб-разметки. Пожалуй, для рекламного продакшена это сигнал: генерация моушна смещается от непредсказуемой диффузии к строгому коду, где типографика не плывёт, а фирменные цвета берутся прямиком из CSS.

McDonald's превращает экраны заказов в рекламную сеть на миллиард долларов

The image shows a McDonald's restaurant sign against a dark blue sky. The sign is illuminated by a bright yellow arch, which is the iconic symbol of the fast-food chain. The sign is primarily red with white lettering, and it displays the text "McDonald's" and "Billions and Billions" in white. The sign is positioned in
Фото: Adweek

Пока посетитель выбирает бургер на тачскрине, рядом с картошкой фри появляется баннер сторонней компании. McDonald's решил превратить торговые залы в медиаплощадку: сеть запустила пилот собственной коммерческой рекламной сети в 450 собственных ресторанах на территории США. Точки франчайзи в эксперимент пока не вошли — технологию обкатывают исключительно на корпоративных локациях.

Чужие бренды теперь размещаются на привычных поверхностях фастфуд-гиганта:

  • экранах терминалов самообслуживания;
  • дисплеях зоны выдачи заказов;
  • фирменном мобильном приложении и остальных цифровых каналах сети.
The image shows a McDonald's restaurant with a large yellow "Order Here" sign prominently displayed. The restaurant is situated in a parking lot, with a white pickup truck parked nearby. The parking lot is bordered by a curb and features yellow poles. The restaurant's exterior is primarily brown, with a section of a br
Фото: Bloomberg

Запустить такой инвентарь позволила масштабная перестройка систем: компания связала в единый контур терминалы заказов, программу лояльности, маркетинг и пользовательские данные. Охваты у витрины колоссальные: ежедневно McDonald's обслуживает более 70 миллионов клиентов по всему миру, а около 85% жителей США заходят в рестораны хотя бы раз в год. По словам главы маркетинга сети Морган Флэтли, компания видит в собственном медиабизнесе потенциал на несколько миллиардов. Ближайшая планка — достичь 1 миллиарда долларов рекламной выручки, правда, точных дедлайнов руководство сети пока не называет.

Для креативных агентств и моушн-дизайнеров открывается совершенно непривычный носитель — экраны импульсивного выбора с максимальной концентрацией внимания. Похоже, скоро нам придется учиться верстать продуктовые интеграции под интерфейсы терминалов, где главный конкурент креатива за взгляд зрителя — кнопка добавления сырного соуса.

Google выпустил Gemini 3.8 TTS с режиссурой актерских ремарок и диалогами

The image is a promotional graphic for the release of the Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS. The background is a gradient of light blue, with a stylized, abstract design that resembles a starburst or a burst of light. The text "Introducing Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS" is prominently displayed
Фото: Google

Персонаж вздыхает посреди реплики, тихо усмехается и перебивает собеседника на полуслове — теперь это не ручная сборка дорожки в аудиоредакторе, а текстовый промпт. Google выкатил линейку Gemini 3.8 TTS, заточенную под озвучку с живым характером. Вместо стерильного дикторского бубнежа модели скормили нюансы актерской игры: паузы, смех, вздохи и междометия вроде «ага» или «угу». Система понимает обычные режиссерские ремарки прямо в сценарии, меняя подачу сцены на лету, и способна вести нативный диалог между двумя спикерами без распада тембра на дистанции в несколько часов.

Что внутри линейки

Семейство разделили под две разные задачи:

  • Gemini 3.8 Flash TTS — инструмент для арта, анимации и проработки сложных игровых характеров, где важна тонкая нюансировка.
  • Gemini 3.8 Flash-Lite TTS — экономный вариант для тяжелых объемов контента, когда нужно озвучить гигабайты текста с минимальными затратами.
The image presents a table titled "Risk Factors for Financial Institutions" with a subtitle "Risk Factors for Financial Institutions - United States". The table is divided into two columns, with the left column labeled "Risk Factors" and the right column labeled "United States". The table contains a series of rows and
Фото: Google

В библиотеку зашили больше 2000 готовых голосов на 100 с лишним языках и диалектах — от квебекского французского и мексиканского испанского до шотландского английского. Клонирование тембра требует аудиосэмпл длиной всего в 30 секунд. Правда, ради безопасности процесс сопроводили обязательной проверкой согласия автора голоса и защитой скрытым водяным знаком SynthID. Скоро обещают добавить инструмент ремикса, чтобы крутить высоту, темп и акценты как эквалайзер.

The image presents a detailed diagram of a therapeutic relationship, likely from a therapeutic relationship model. The diagram is divided into two main sections: "Therapist" and "Client". The "Therapist" section is represented by a light blue rectangle with a darker blue border, and it contains the following informatio
Фото: Google

В тестах модели забрали верхние строчки. В Hume AI Voice Design система лидирует с баллом 71.4 и держит 60.8 за акценты, а Flash и Flash-Lite заняли первое и второе места в Hume AI Overall Quality. В Voice Arena нейросеть обошла конкурентов на японском, арабском, хинди, вьетнамском, мексиканском испанском и бразильском португальском. Правда, географию клонирования пока урезали: функция недоступна в Евросоюзе, Великобритании, Швейцарии, Индии, а также в американских штатах Иллинойс и Техас.

The image presents a table titled "Disease Frequency Distribution" with a header row. The table is divided into three columns: "Disease", "Frequency", and "Percentage". The first column lists the diseases, the second column lists the frequency of each disease, and the third column lists the percentage of people affecte
Фото: Google

Для моушн-дизайнеров и инди-аниматоров это меняет механику черновой озвучки. Собрать диалоговый аниматик с правдоподобными актерскими интонациями теперь можно прямо на этапе раскадровки, не дожидаясь записи живых актеров.

Университет Аалто выложил в открытый доступ вековой архив скандинавского дизайна

Иллюстрация: редакция ЗДЕСЬ

Лекционные диапозитивы Кая Франка о законах композиции и рукотворные чертежи Алвара Аалто теперь можно рассмотреть в деталях прямо в браузере. Университет Аалто запустил публичный цифровой портал Aalto Repository. Архитектурная база, которую десятилетиями копили финские мастерские, превратилась в открытую систему долгосрочного хранения: за техническую сторону отвечает платформа Preservica, а за сохранность фондов — подразделение Aalto University Archives.

Каталог разбит на пять базовых разделов: учебные материалы (Opetusaineistot), студенческие проекты (Oppilastyöt), частные фонды (Yksityisarkistot), персональные архивы (Henkilöarkistot), а также художественные и музейные коллекции (Taide- ja museokokoelmat). Внутри собраны пласты визуальной культуры с начала прошлого века:

  • Чертежи и проектная графика архитекторов — от Алвара Аалто и Йохана Жака Аренберга до Харри Мойланена и Хельмириитты Хонканен;
  • Дипломные проекты и графические приложения архитектурного факультета и градостроительного отделения за период с 1905 по 1953 год;
  • Исследования по истории декоративного искусства, орнаментике и архитектурным обмерам;
  • Практические работы студентов отделений керамики и художественного стекла;
  • Ботанические иллюстрации Digi-Botanica, фонды отдела геодезии (Maanmittausosasto) и ландшафтной архитектуры;
  • Документы лаборатории низких температур (Low Temperature Laboratory) и экономического факультета (Kauppatieteellinen ala).

Интерфейс не заставляет листать всё подряд: искать исходники можно по ключевым словам с логическими операторами AND, OR, NOT и маскированием через звездочку (*), либо вручную через каталог коллекций. Каждый файл сопровождается паспортом с датой, автором и правилами цитирования. Объекты распространяются под лицензиями Creative Commons либо со статусом Rightsstatements InC-EDU — он защищает копирайт, но разрешает образовательное использование. Единственное железное требование ко всем, кто берет графику в работу, — указывать авторов, тип лицензии и ссылку на репозиторий как первоисточник.

Для дизайнеров и арт-директоров это редкий шанс залезть под капот северного модернизма без посредников и стоковых фильтров. Нас подкупило, что проектная кухня финских школ теперь доступна в один клик — чистое сырье для ресерча и типографических экспериментов.

Модель Agora-2 научилась собирать интерактивные миры для двадцати игроков

The image depicts a medieval-themed scene set in a dark, stone-walled room with arched doorways and windows. The room is illuminated by a blue glow emanating from a doorway. A group of adventurers, including a knight in armor, a woman in a green cloak, a woman with a red cloak, and a woman with a red cloak and a bow an
Фото: Odyssey

Двадцать персонажей бродят по изометрическому подземелью, огибают стены и реагируют на действия соседей — только за физику и геометрию здесь отвечает не классический движок, а нейросеть. Компания Odyssey представила Agora-2, обновленную модель мира для генерации интерактивных пространств в реальном времени. Если первая версия системы Agora-1 справлялась лишь с одиночными сценами для небольшой группы, то здесь планку подняли сразу в пять раз: симуляция теперь удерживает до 20 участников одновременно, распределяя нагрузку между живыми людьми и ИИ-агентами сразу в нескольких параллельных средах.

Базой для тренировки послужили геймплейные записи Diablo II от Blizzard. Разработчики скормили модели массивы наблюдений, действий и состояний, превратив алгоритм в обучаемый движок со строгим разделением ролей:

  • Симуляционный сервер прогнозирует общее состояние мира через механизм внимания, удерживая свойства объектов, геометрию локаций и недавние шаги участников.
  • Свойства сущностей сохраняются в памяти вне зависимости от ракурса камеры: если отвернуться от персонажа, он не исчезнет и не потребует повторной генерации при возвращении взгляда.
  • Модель рендеринга на основе согласования потоков (flow matching) собирает персональный поток пикселей из сжатого представления, учитывая разный уровень визуального шума.
  • Непрерывный цикл обратной связи превращает каждый свежий кадр в визуальную историю для следующего шага симуляции.
The image depicts a video game scene set in a dark cave environment. The game's interface is primarily dark gray or black, with gold accents. The player's character is a female warrior, standing on a rocky surface. The game's title screen displays "The Den of Evil" and the player's score of 1P. The game's interface inc
Фото: Odyssey

Поведение самих агентов шлифовали обучением с подкреплением при частично открытой карте: они умеют преследовать противников, обходить препятствия и выбираться из тупиков. Их соперничество формирует автоматические учебные программы, которые Odyssey планирует внедрять в свои фундаментальные модели вроде Odyssey-3. Список применений выходит далеко за рамки видеоигр: авторы метят в робототехнику, беспилотный транспорт, оборонные системы, энергетику и кибербезопасность — вплоть до защиты от сговора автономных агентов и отражения сетевых атак.

The image presents a detailed diagram of a simulation model, divided into three main sections: "Simulation Model", "Predicted State Changes", and "World Server". The Simulation Model section is the central focus, featuring a black rectangle with a gradient of colors representing the movement of entity tokens. The "Pred
Фото: Odyssey

Нас в этой истории подкупает смена производственной логики: интерактивное окружение больше не обязательно собирать руками из полигонов, разверток и шейдеров. Для моушн-дизайнеров и авторов виртуального продакшена это редкая возможность увидеть генерацию трехмерной логики прямо из сырых пикселей — игровая превью-версия и технический отчет уже выложены в открытый доступ. Пожалуй, традиционным рендерам пора готовиться к очень непривычному соседству.

Видео: Odyssey

В интерфейсе ChatGPT обнаружили подписку Pro Max за 500 долларов в месяц

The image presents a comparison of three business plan upgrades from a website, likely a comparison tool or website. The leftmost section displays the "Plus" plan, priced at $20 per month, with a standard seat and a maximum of 5 work hours per day. The middle section showcases the "Business" plan, priced at $100 per mo
Фото: BleepingComputer

Датамайнеры залезли в код фронтенда ChatGPT и наткнулись на строчку, от которой вздрогнет продюсер любого небольшого продакшена: тариф Pro Max с ценником 500 долларов в месяц. Без учета налогов. В странах с НДС финальный чек составит около 600 долларов. Находку в конфигурациях сделали аккурат за пять дней до вторничной конференции DevDay, запланированной на 29 сентября, хотя сама компания релиз пока не комментирует.

Судя по утечке, новый тариф метят в долгие расчеты с ИИ-агентами и масштабную разработку. В коде уже прописан слоган — «Fastest Work + Fastest Codex». Точные лимиты запросов пока не ясны, но ускорение планируют серьезное: пользователи обсуждают вероятное подключение серверных мощностей Cerebras. Картинка складывается занятная, особенно с учетом того, что OpenAI недавно заморозила оформление текущего плана Pro за 200 долларов. Серверные ресурсы, похоже, просто перетасовывают под более дорогой уровень, который обойдется в два с половиной раза дороже прежнего максимума.

По-нашему, для арт-директоров и студийных техдиров пять сотен долларов перестают быть безумием в тот момент, когда генеративные пайплайны встают на конвейер. Обычные лимиты сгорают к обеду, если повесить на агентов автоматическую сборку сцен, скрипты для пакетов графики или сортировку массивов ассетов. За скорость и непрерывность процессов всегда платили сполна — теперь просто сменился адресат платежки.

Ещё дневной рекап