TGViewer
Книжный куб Книжный куб @book_cube · 15.8K subscribers
Post #4466 2.82K
Silicon sampling (Рубрика #RnD)

Сегодня я общался с коллегой, что занимается у нас платформой для проведения качественных и количественных исследований (привет, Андрей). В ходе общения я вспомнил про этот интересный и быстроразвивающийся подход к их проведению, где LLM получает социодемографическую «биографию» (backstory) персоны и отвечает на вопросы опроса от её имени. Это позволяет воспроизводить мнения тысяч демографических групп без рекрутинга реальных участников. Дальше мне стало интересно, а какие вообще существуют ключевые исследования в этой теме и так я получил подборку ниже

- Argyle et al., 2023 - "Out of One, Many" - это классическая основополагающая работа, которая вводит понятие "алгоритмической точности" (algorithmic fidelity). GPT-3 использует backstories из ANES и Pew. (потом еще вышла в Political Analysis от Cambridge)
- Aher, Arriaga, Kalai (ICML 2023) - "Using Large Language Models to Simulate Multiple Humans and Replicate Human Subject Studies" — метод репликации классических социологических экспериментов (Milgram, Ultimatum Game и др.) на популяции LLM-персон без единого живого участника.
- Santurkar et al. (2023) - "Whose Opinions Do Language Models Reflect?" - создали датасет OpinionQA из 500 спорных вопросов, сравнили 9 LLM с 60 демографическими группами США. Вывод: несоответствие сравнимо с пропастью между демократами и республиканцами по климату.
- Hu & Collier (2024) - "Quantifying the Persona Effect" - персона объясняет менее 10% дисперсии, но даёт статистически значимый прирост. Найдена линейная зависимость: чем сильнее корреляция переменных персоны с мнением, тем точнее симуляция.
- Tejaswani Dash et al (2025) - "Polypersona: Persona-Grounded LLM for Synthetic Survey Responses" - open-source фреймворк с датасетом из 3 568 ответов по 433 уникальным персонам, предназначен для instruction-tuning
- Taday Morocho et al. (2026) - "Assessing the Reliability" - протестировали 70 000+ пар на данных World Values Survey. Persona prompting не даёт стабильного улучшения и в ряде случаев ухудшает результат.

Подход выглядит как вундер-вафля, но есть и некоторые проблемки
- Ordering bias (модели систематически предпочитают первый вариант ответа
- Underrepresented groups - 65+, вдовцы, меньшинства воспроизводятся хуже всего
- Корреляционная слепота - fine-tuned модели точнее по маргиналям, но обе техники не восстанавливают латентную структуру корреляций реальной популяции
В whitepaper Lin (2024) в "Six Fallacies in Substituting Large Language Models for Human Participants" систематически перечисляются типичные ошибки в интерпретации таких исследований.

А вообще, если вы делаете платформу для количественных и качественных исследований, то есть смысл добавить туда "silicon sampling" как один из подходов для проведения исследований:)

#AI #Engineering #RnD #Science #Research
arXiv.org Out of One, Many: Using Language Models to Simulate Human Samples We propose and explore the possibility that language models can be studied as effective proxies for specific human sub-populations in social science research. Practical and research applications...
  • ❤ 3
  • 🔥 3
  • 😐 2
  • 👍 1
More from @book_cube
  1. Oct 9, 2026The Man from the Future: The Visionary Life of John von Neumann (Человек из будущего. Жизн…
  2. Oct 9, 2026Материалы Research Insights #34: долгоживущие агенты и передача работы (Рубрика #AI4SDLC)…
  3. Oct 9, 2026Заходите на прямой эфир Research Insights - сегодня серия с обсуждением мартовской статьи…
  4. Oct 9, 2026По традиции я раз в год участвую в благотворительной акции с механикой аукциона, где можно…
  5. Oct 8, 2026Материалы Code of Leadership №84: разработчик становится менеджером в эпоху AI? (Рубрика #…
  6. Oct 8, 2026Проектирование обвязки для длительной (автономной) разработки приложений (Рубрика #AI4SDLC…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →