Это первый раз, когда ИИ-агенты доказали свою реальную профпригодность в навигации по десктопу. В свежем отчете a16z есть статистика, от которой трудно отмахнуться: на стандартизированном тесте OSWorld-Verified модель Claude Fable 5 успешно закрывает 85% задач. Для контекста — живые тестировщики справляются в среднем лишь с 72%. Модели научились уверенно кликать, скроллить и заполнять формы в легаси-софте, где нет и никогда не будет чистого API.
Самое интересное сейчас происходит за пределами гонки бенчмарков. Сырая способность нейросети понимать интерфейс стала базовой функцией, поэтому фокус сместился на инфраструктуру. Чтобы агент мог стабильно обновлять записи в CRM или собирать данные с государственных порталов, нужна жесткая обвязка: песочницы, обработка ошибок, права доступа и кэширование. Если сайт ритейлера внезапно меняет верстку, именно инфраструктура решает, упадет ли весь процесс. Крупные операторы автоматизации уже даже не смотрят, какая конкретно модель крутится под капотом — вендоры меняют их на лету.
Математика таких внедрений бьет по классическому рынку аутсорсинга! Час работы компьютерного ИИ-агента обходится на 30–40% дешевле услуг оператора из Индии или Филиппин, и на 500% дешевле сотрудника в США. Агенты все еще легко ломаются на сложных непредсказуемых сценариях, требующих интуиции. Но для линейной бэкофис-рутины их круглосуточная доступность и возможность бесконечного масштабирования делают ручной труд экономически нецелесообразным.
Поделиться:
Почему автор обложек Tame Impala и The Weeknd работает в старых версиях Photoshop
Выпуск открытой видеомодели LTX-2.5 от Lightricks с обновленным диффузионным декодером