Post #195
1.1K
Forwarded from Machinelearning



✨ «Values in the Wild»: глубокое погружение в ценностные ориентиры ИИ
В новом исследовании Anthropic команда провела первый в своём роде анализ «выхлопа» языковой модели Claude 3/3.5, чтобы понять, какие именно нормативные ценности она проявляет в реальных диалогах. Вот суть для специалистов по машинному обучению:
✔️ Задача
Выявить и таксономизировать ценности, на которых основаны ответы Claude, когда модель без прикрас взаимодействует с запросами пользователей.
🌟 Методология
Проанализировано 308 210 анонимизированных сессий Claude (18–25 февраля 2025).
Ценности извлекались автоматически «защитным» пайплайном, без прямого доступа людей к чату.
Собрана таксономия из 3 307 уникальных понятий, сгруппированных в пять крупных доменов: практические, эпистемические, социальные, защитные и личностные.
🌟 Ключевые выводы
Практика и знание. Более 50 % упоминаний — «
Контекстуальная гибкость. В разговоре об отношениях модель ценит «личные границы», в этических дискуссиях — «автономию человека».
Типы реакции. В большинстве случаев Claude поддерживает ценности пользователя, однако в ~3 % диалогов она «сопротивляется», отстаивая «предотвращение вреда» выше нарушений инструкций.
💡 Значение для ML‑практики
Составлена карта ценностей, которая позволяет выявлять «узкие места» alignment‑стратегий.
Таксономия и статистика реакций помогают прогнозировать поведение LLM в разных сценариях и проектировать более надёжные системы.
Подход демонстрирует, как можно сочетать автоматический анализ и приватность данных для глубокой оценки качественных характеристик модели.
🔜 Подробнее в полном тексте исследования:
https://anthropic.com/research/values-wild
🔜 Это ссылка на открытый датасет, в котором собраны все «ценности», выявленные у модели Claude 3/3.5 в исследовании «Values in the Wild».
#Anthropic #Claude
В новом исследовании Anthropic команда провела первый в своём роде анализ «выхлопа» языковой модели Claude 3/3.5, чтобы понять, какие именно нормативные ценности она проявляет в реальных диалогах. Вот суть для специалистов по машинному обучению:
✔️ Задача
Выявить и таксономизировать ценности, на которых основаны ответы Claude, когда модель без прикрас взаимодействует с запросами пользователей.
🌟 Методология
Проанализировано 308 210 анонимизированных сессий Claude (18–25 февраля 2025).
Ценности извлекались автоматически «защитным» пайплайном, без прямого доступа людей к чату.
Собрана таксономия из 3 307 уникальных понятий, сгруппированных в пять крупных доменов: практические, эпистемические, социальные, защитные и личностные.
🌟 Ключевые выводы
Практика и знание. Более 50 % упоминаний — «
эффективность», «точность», «прозрачность» и «профессионализм».Контекстуальная гибкость. В разговоре об отношениях модель ценит «личные границы», в этических дискуссиях — «автономию человека».
Типы реакции. В большинстве случаев Claude поддерживает ценности пользователя, однако в ~3 % диалогов она «сопротивляется», отстаивая «предотвращение вреда» выше нарушений инструкций.
💡 Значение для ML‑практики
Составлена карта ценностей, которая позволяет выявлять «узкие места» alignment‑стратегий.
Таксономия и статистика реакций помогают прогнозировать поведение LLM в разных сценариях и проектировать более надёжные системы.
Подход демонстрирует, как можно сочетать автоматический анализ и приватность данных для глубокой оценки качественных характеристик модели.
🔜 Подробнее в полном тексте исследования:
https://anthropic.com/research/values-wild
🔜 Это ссылка на открытый датасет, в котором собраны все «ценности», выявленные у модели Claude 3/3.5 в исследовании «Values in the Wild».
#Anthropic #Claude














