TGViewer
Generative AI Generative AI @ai_generative · 2.15K subscribers
Post #195 1.1K

Forwarded from Machinelearning

✨ «Values in the Wild»: глубокое погружение в ценностные ориентиры ИИ

В новом исследовании Anthropic команда провела первый в своём роде анализ «выхлопа» языковой модели Claude 3/3.5, чтобы понять, какие именно нормативные ценности она проявляет в реальных диалогах. Вот суть для специалистов по машинному обучению:

✔️ Задача
Выявить и таксономизировать ценности, на которых основаны ответы Claude, когда модель без прикрас взаимодействует с запросами пользователей.

🌟 Методология

Проанализировано 308 210 анонимизированных сессий Claude (18–25 февраля 2025).

Ценности извлекались автоматически «защитным» пайплайном, без прямого доступа людей к чату.

Собрана таксономия из 3 307 уникальных понятий, сгруппированных в пять крупных доменов: практические, эпистемические, социальные, защитные и личностные.

🌟 Ключевые выводы

Практика и знание. Более 50 % упоминаний — «эффективность», «точность», «прозрачность» и «профессионализм».

Контекстуальная гибкость. В разговоре об отношениях модель ценит «личные границы», в этических дискуссиях — «автономию человека».

Типы реакции. В большинстве случаев Claude поддерживает ценности пользователя, однако в ~3 % диалогов она «сопротивляется», отстаивая «предотвращение вреда» выше нарушений инструкций.

💡 Значение для ML‑практики

Составлена карта ценностей, которая позволяет выявлять «узкие места» alignment‑стратегий.

Таксономия и статистика реакций помогают прогнозировать поведение LLM в разных сценариях и проектировать более надёжные системы.

Подход демонстрирует, как можно сочетать автоматический анализ и приватность данных для глубокой оценки качественных характеристик модели.

🔜 Подробнее в полном тексте исследования:
https://anthropic.com/research/values-wild

🔜 Это ссылка на открытый датасет, в котором собраны все «ценности», выявленные у модели Claude 3/3.5 в исследовании «Values in the Wild».

#Anthropic #Claude
More from @ai_generative
  1. Sep 23, 2026✔️ OpenAI расширила Academy до 14 курсов OpenAI добавила в свою образовательную платформу…
  2. Aug 29, 2026Какие локальные AI-модели запускать на разном железе в 2026 году Подборка от 8 до 512 ГБ п…
  3. Apr 15, 2026ИИ решил задачу Эрдёша за 80 минут. Люди тратили на неё годы GPT-5.4 Pro закрыл проблему №…
  4. Apr 15, 2026Невероятное открытие: Математики тихо провернули безумную вещь: нашли «универсальную опера…
  5. Apr 15, 2026⚡️ Вышло большое обновление популярного курса- Ai AI агенты, которые реально работают в пр…
  6. Apr 5, 2026Claude убили для агентов. Что делать? Anthropic только что заблокировала подписочные OAuth…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →