все используют ии. почти никто не получает от него ошеломительных результатов.
вот, почему
как обычно выглядит работа с ИИ у 99% людей?
человек формулирует запрос ▶️получает ответ ▶️ оценивает качество ответа, если нужно – перефразирует ▶️ снова спрашивает
и так может продолжаться до бесконечности пока
а) пользователь не получит хоть сколько-то приемлемый результат и принимает его, руководствуясь своим представлением о прекрасном ИЛИ
б) пока ИИ не начнет галлюцинировать или жаловаться на израсходование всех токенов – а пользователь остаётся без результата
в обеих случаях частый исход – "нууу такое"
и он вытекает из того, как мы до ИИ-революции научились общаться с машинами: нам приходилось трансформировать свои мысли в удобоваримые инструкции для существоваших технологий и исполнителей.
👨💻дизайнер, которому удобнее объяснить идею через скетч, часами переписывал её в сухое ТЗ, чтобы поставить задачу разработчику.
👨💻исследователь, который мыслил цитатами, паттернами и связями, тратил часы за составлением дизайна исследований и кодировкой результатов в таблицах
👨💻маркетолог, у которого в голове образ и ощущение, должен это приземлить в бриф для подрядчика, чтобы они полностью поняли его замысел и могли его воплотить
перевод с языка мышления на язык инструмента был постоянной фоновой потерей.
все идеи нужно было "ужать", чтобы их точно могли переварить люди и технологии на другом конце провода и выдать хотя бы на 70% что-то приемлемое
а как иначе?
довольно давно у нейропсихологов появилось понятие «синестезия» – состояние, при котором сигнал из одного канала восприятия автоматически активирует другой.
например, композитор Скрябин слышал музыку как цвет, не метафорически, а буквально: ля-бемоль мажор был фиолетовым.
большинству людей это недоступно.
но сейчас именно концепция "синестезии" становится точным описанием того, как нужно поменять свой майндсет касательно ИИ-инструментов, чтобы получался "вау"-результат
за последние 2 года ИИ-модели серьезно шагнули вперёд в том, что называется "мультимодальностью", то есть способностью работать в разных форматах: текст, изображения, видео, звук и так далее.
помню, в 2024 делала проект для "Алисы" яндекса, и тогда мультимодальность только-только становилась доступной в массовых продуктах.
а сегодня мы вайбкодим и жалуемся на ИИ-исполнителей в топе стримингов 😭
и вот в чём суть перехода к мультимодальности
раньше даже самые продвинутые модели работали как бюро переводов: ты даёшь текст в удобоваримой для них форме, они обрабатывают текст, возвращают текст.
картинки, звук, код шли через отдельные системы, которые не разговаривали между собой на одном языке.
смысл неизбежно терялся при передаче.
сегодня архитектура принципиально другая. самые популярные ИИ-модели обучались сразу на всём одновременно, и в результате внутри модели сформировалось единое латентное пространство: общая числовая среда, в которой, например, «одиночество» в тексте, фотография пустой комнаты и минорная тональность могут быть обнаружены машиной в едином ряду ассоциаций.
именно здесь синестезия становится точной аналогией того, как мы должны мыслить сейчас.
Скрябин не переводил ля-бемоль мажор в фиолетовый через словарь. оба сигнала активировались из одного нейронного источника одновременно.
мультимодальные модели устроены похожим образом: они не переключаются между форматами, они читают смысл напрямую из любого из них, потому что все форматы живут в одном пространстве. следовательно, нам не нужно заниматься переводом с человеческого на машинный
мы больше не обязаны «ужимать» мысль до текста, чтобы машина нас поняла.
можно показать скетч и объяснить голосом.
можно загрузить таблицу с данными и спросить «вот что я вижу, ты видишь то же самое?».
можно описать ощущение и оформить его структуру, заранее научив модель skills или подключив специальный коннектор.
модель больше не ждёт правильно оформленного запроса — она ожидает от нас смысл и указание формата, в котором мы хотим получить итоговый результат.
Post #33
241
- ❤ 7
- 🔥 4
- 🥰 2
- 😐 1