Очень странный пост
По-моему я определилась с гештальтом на следующие 3 года.
До этого у меня было: поиск аномалий в логах, как находить, как интерпретировать,
можно ли это сделать чисто? И быстро. И универсально.
Я 3 года разными способами пыталась это сделать, тех лид моей лабы нашел тот винтик, что мне не доставало.
Теперь все понятно, больше не интересно.
Артем Семенов PWN AI написал статью о всех возможных (на сегодняшний день!)
проблемах, что порождают промпт-инъекции. Ниже будет ссылка.
И почему-то мне сразу пришла в голову мысль о книге: "Истоки морали",
человеческие индивидуумы подвержены такими же проблем, если у них нет той самой морали.
Психопаты, нарциссы, социопаты.
*Социопаты — это не "ошибка в коде", это побочный эффект оптимизации под выживание. Точно так же Jailbreak (взлом промпта) — это не баг, а фича перебора вариантов.
Вот этот: эмоциональный интеллект, что чаще влияет на наш "основной" интеллект или разрушающе,
или вдохновляюще.
*И если мы разделим каналы для LLM (один канал — "знания", второй — "личность/инструкции"), то мы просто повторим эволюционный трюк: отделим префронтальную кору (рассуждения) от лимбики (цензура/мораль).
-------------------------------------
В ноябре 2024 года, компания OpenAI выделила грант Университету Дьюка на проект «Исследование морали ИИ». Цель исследования — разработать алгоритмы, которые смогут предсказывать моральные суждения человека в сложных ситуациях, таких как медицина, право и бизнес.
Главный исследователь проекта — профессор практической этики Университета Дьюка Уолтер Синнотт-Армстронг. Вместе с коллегой Яной Борг он ранее изучал возможности ИИ в качестве помощника в принятии этически обоснованных решений.
Завершение работы запланировано на 2025 год.
Однако эксперты выражают сомнения в возможности создания таких алгоритмов, учитывая сложность и субъективность морали.
*Основные аргументы:
- Статистическая природа ИИ: Современные LLM — это статистические машины, которые не понимают моральных концепций, а лишь воспроизводят закономерности из данных.
- Субъективность морали: Не существует универсальной морали, она субъективна и варьируется в зависимости от культур и убеждений. Например, Claude отдаёт предпочтение кантианству, а ChatGPT — утилитаризму.
- Культурные предубеждения: ИИ может воспроизводить ценности западных стран, так как обучается на данных из интернета, где эти точки зрения доминируют.
- Исторические неудачи: Предыдущие попытки создания «морального ИИ» (например, инструмент Ask Delphi от Института Аллена) показали, что даже незначительное изменение формулировки вопроса может привести к абсурдным или опасным выводам
------------------------------------
А еще вот:
Исследование "Emergence of psychopathological computations in large language models" (Lee et al., 2025). Эта работа представляет собой первое доказательство того, что в LLM возникают сетевые вычисления, характерные для психопатологии.
Что они нашли: Они выявили, что в LLM существуют дисфункциональные репрезентативные состояния, которые могут распространяться и самоподдерживаться, "запирая" модель в проблемных паттернах.
Связь с размером модели: Чем больше LLM, тем плотнее и сильнее становятся причинно-следственные связи между этими "психопатологическими" вычислительными единицами. У больших моделей эта "предрасположенность" к патологическим вычислениям растет, даже несмотря на то, что они лучше следуют инструкциям.
Главный вывод: Поведение LLM, напоминающее психопатологию, может быть не поверхностным подражанием, а особенностью их внутренней обработки.
------------------------------------
Короче, пошла я исследовать, что там можно по разделению каналов для LLM сделать, и улучшить ли это-что или хз.
*А игры в Бога очень сложная штука для моих инженерных мозгов.
Post #377
169
- ❤ 3
- 👍 1