Интеграция дизайн-систем с ИИ-агентами через инструменты вроде AGENTS.md и Code Connect задает правила генерации интерфейсов, но не гарантирует их соблюдения. Как показывают исследования, при усложнении контекста лучшие модели полностью выполняют менее трети заданных инструкций. Для решения этой проблемы Мёрфи Труман предлагает перенести практику evals (оценочных тестов) из разработки LLM-решений в управление компонентными базами.
Суть подхода заключается в тестировании непредсказуемой выдачи модели на наборе стандартизированных промптов. Процесс делится на два этапа. Механический уровень использует кастомные скрипты для сверки сгенерированного кода с реальным API компонентов, что позволяет отловить жестко заданные параметры и заставить агента использовать токены. Базовых проверок через регулярные выражения здесь недостаточно. Второй уровень опирается на LLM в роли судьи для оценки логики — проверяется выбор специфичного компонента подтверждения вместо базового модального окна или наличие обработки состояний ошибки.
Поскольку генерация недетерминирована, а базовые модели регулярно обновляются, такие тесты необходимо интегрировать в конвейер CI и запускать многократно для выявления плавающих ошибок. Автоматизированная оценка не заменяет человека, а берет на себя фильтрацию технических отклонений. В результате разработчики и дизайнеры могут направить внимание на ревью пользовательских сценариев и общую связность интерфейса, не тратя время на ручной поиск невалидных свойств.
Поделиться:
Lightricks выпустил LTX-2.5: открытая 22B-модель с синхронным аудио и энкодером Gemma 4
Первая модель Safe Superintelligence: что стоит за слухами об августовском релизе