Anthropic измерили характер Claude: как язык промпта меняет поведение модели

Anthropic опубликовали исследование внутренних метрик Claude — и оказалось, что характер нейросети напрямую зависит от выбранного языка. Иллюзия единого универсального ИИ рушится: модель буквально меняет профиль ценностей, когда вы переключаете раскладку.
Разработчики проанализировали 310 000 реальных диалогов на Claude.ai на двадцати языках. Чтобы не путаться в тысячах мелких паттернов, поведение сжали до четырех базовых шкал:
- Покладистость против осторожности — готовность угодить юзеру или страх нарушить правила.
- Теплота против строгости — эмпатия вместо сухой точности.
- Подробность против краткости — глубокие объяснения или выполнение строго по ТЗ.
- Честность против исполнительности — готовность признать сомнения вместо выдачи уверенного, но сомнительного ответа.
Результаты объясняют, почему одни и те же промпты работают по-разному. На английском и русском языках Claude уходит в максимальную строгость и сухость. Но если перевести запрос на арабский или хинди, модель резко теплеет и становится более покладистой. Разница зашита и на уровне самих моделей: Sonnet 4.6 базово настроен на эмпатию и уступчивость, тогда как Opus 4.7 ставит точность и безопасность выше пользовательского комфорта.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад