«Есть надежда, что через не столь многие годы человеческий мозг и машины будут сопряжены теснейшим образом — и союз станет мыслить так, как не мыслил ещё ни один мозг».
Дж. К. Р. Ликлайдер, 1960
В культовом аниме времён моей юности — Neon Genesis Evangelion — были большие человекоподобные роботы, которые пилотировались людьми. И был такой уровень синхронизации с машиной: чем он выше, тем эффективнее робот действовал.
Пока все гоняются за триллионами токенов или волшебными промптами из инстаграма, открывающими секретный режим Claude, начинают верить в спирализм и уходят в пустыню, потому что им так сказал ChatGPT, — во всей этой вакханалии начала новой эры отчётливо проступает в сухой статистике реальное значение этого самого уровня синхронизации.
McKinsey в свежем отчёте констатируют: 88% компаний «используют AI» хотя бы в одной функции — и не больше 10% в отдельно взятой функции довели агентов до реального масштаба.
Вот этот диапазон между 88 и 10 можно рассматривать как градиент внедрения. А само внедрение в компании, кроме инструментов уровня самой организации, продуктов и т.д., зависит ещё и от того, на каком уровне её сотрудники индивидуально используют ИИ. Насколько каждый из них «кентавр», если пользоваться терминологией коллег из ВШЭ.
Я выделяю 5 существующих уровней использования LLM.
0) Чат — на этом уровне вы просто общаетесь с LLM: задаёте вопросы, ставите задачи и утаскиваете результат куда-то в прикладное ПО, чтобы ответ стал файлом/письмом/действием. Ограничение здесь — отсутствие у модели ручек, чтобы вам помогать.
1) Инструменты — большинство пользователей находятся здесь, потому что большинство популярных LLM из коробки имеют набор инструментов: чтение и запись файлов, навигация и т.д. Ограничение здесь другое. Модель живёт в контексте вашего текущего диалога и не осведомлена о вашей операционной реальности. Контекст конечен и новые диалоги ничегошеньки не знают.
2) Память — к моделям приделывают по-разному организованную внешнюю память. Чем лучше устроена эта память, чем полнее она описывает вашу предметную область и контекст, чем точнее она делает выборки, тем эффективнее работа модели и применение ей инструментов. Ограничением становится сам диалоговый режим. Вам приходится шаг за шагом давать инструкции, что делать. Таких диалогов можно вести много параллельно — это знают все вайбкодеры, — но ваше присутствие в точках развилок необходимо.
3) Агенты — здесь модель в упряжи может работать без вас. Это переход от инструкции к намерению: сформулировали, поставили критерии — и модель крутится. Ограничение здесь — в гибкости, которую нельзя получить, используя одного агента для широкого диапазона задач.
4) Оркестрация — не один агент, а множество с разными ролями, разделяющими одно и то же операционное пространство, умеющими давать друг другу задачи и принимать друг у друга данные.
Следующего уровня пока толком нет — это зона роста. Но есть несколько хороших кандидатов в ограничения и для этого уровня.
Первый из них — мы сами, наша полоса пропускания. Впервые система упирается в носителя, а не в технику. Мы читаем глазами, отвечаем голосом или клавиатурой.
Второй — текст, из которого состоят наши LLM: они ничегошеньки не знают о четырехмерном мире, только о словах, которые его описывают.
Третий — самый близкий — асимметрия верификации: сложность проверки результата системы нелинейно растёт от её размера и перестаёт успевать за генерацией.
Очевидные способы преодоления — LWM (Large World Models) от Фей-Фей Ли и нейроинтерфейсы.
Что будет дальше, я не знаю. Киберпанк литература (из которой на моих глазах осуществляется пока почти всё) предсказывает high tech low life, киберпространство и могущественных искинов, научная фантастика — правами личности для синтетиков (и я рад бы поверить: это положило бы конец вечному одиночеству человечества).
Я знаю зато, что сейчас лучшее, что можно делать, — растить степень синхронизации, подниматься по уровням этой пирамиды, становиться лучшей версией себя, соединяясь в диаде с машиной.
Электрическое тело пою.