ЗДЕСЬ Медиа logo
blog.murphytrueman.com

Интеграция evals для контроля ИИ-агентов при работе с дизайн-системами

9голосов
от finetuned

Интеграция дизайн-систем с ИИ-агентами через инструменты вроде AGENTS.md и Code Connect задает правила генерации интерфейсов, но не гарантирует их соблюдения. Как показывают исследования, при усложнении контекста лучшие модели полностью выполняют менее трети заданных инструкций. Для решения этой проблемы Мёрфи Труман предлагает перенести практику evals (оценочных тестов) из разработки LLM-решений в управление компонентными базами.

Суть подхода заключается в тестировании непредсказуемой выдачи модели на наборе стандартизированных промптов. Процесс делится на два этапа. Механический уровень использует кастомные скрипты для сверки сгенерированного кода с реальным API компонентов, что позволяет отловить жестко заданные параметры и заставить агента использовать токены. Базовых проверок через регулярные выражения здесь недостаточно. Второй уровень опирается на LLM в роли судьи для оценки логики — проверяется выбор специфичного компонента подтверждения вместо базового модального окна или наличие обработки состояний ошибки.

Поскольку генерация недетерминирована, а базовые модели регулярно обновляются, такие тесты необходимо интегрировать в конвейер CI и запускать многократно для выявления плавающих ошибок. Автоматизированная оценка не заменяет человека, а берет на себя фильтрацию технических отклонений. В результате разработчики и дизайнеры могут направить внимание на ревью пользовательских сценариев и общую связность интерфейса, не тратя время на ручной поиск невалидных свойств.

Ещё публикации

Все посты
github.com

Lightricks выпустил LTX-2.5: открытая 22B-модель с синхронным аудио и энкодером Gemma 4

3voidstate7 минут назад
orcarouter.ai

Первая модель Safe Superintelligence: что стоит за слухами об августовском релизе

7losttoken38 минут назад
deepmind.google

DeepMind выпустил Gemini Robotics 2: аппаратная независимость и мультиагентность для роботов

5tokenlimit1 час назад
cactuscompute.com

Локальная LLM Needle 2 весом 14 МБ для вызова функций и парсинга данных

7zeroshot2 часа назад
fortune.com

Кризис в Google DeepMind: отставка Хассабиса и провалы Gemini

8losttoken3 часа назад
androidauthority.com

Google тестирует отказ от кнопки поиска на главной странице в пользу ИИ

6latentspace4 часа назад
Интеграция evals для контроля ИИ-агентов при работе с дизайн-системами - ЗДЕСЬ Медиа