Заметил, как в ленты снова вернулся ярлык AGI
Каждый раз перед крупными релизами маркетологи начинают прогревать аудиторию историями про сверхразум. Примерно год назад, во время релиза GPT-4.5, все это уже проходили: ожиданий было море, а апдейт оказался вполне рядовым. После этого тему замяли, и разговоры про AGI стали восприниматься скорее как далекий маркетинговый буллшит.
Сейчас выходят новые модели у Anthropic, что-то выкатывают OpenAI, и блогеры со СМИ снова наперебой кричат: "Ну вот, теперь это точно AGI".
Спойлер: нет, не он.
Давайте начистоту: модели стали умнее, ризонинг прокачался, автономность выросла. Были заметные кейсы в кибербезопасности, пара научных подвижек у тех же Anthropic и Google. Но это не скачок к AGI.
Во-первых, это узко заточенные сценарии. Во-вторых, и это главное, эти модели использовали топовые профи. Модель не пошла сама в интернет, не обнаружила уязвимость с нуля и не закрыла баг по собственной инициативе. Она была просто эффективным инструментом в руках эксперта.
Определение AGI простое: модель должна быть наравне или лучше человека во всех профессиональных задачах.
Я в таких спорах задаю себе практичный вопрос: что модель может сделать для меня сегодня такого, чего не могла год назад? Могу ли я отдать ей задачу под ключ, не проверяя, и сразу отправить результат дальше?
Банальный пример - сделать сайт. Раньше нужно было вести модель за руку буквально по каждому шагу. Сейчас ей можно скормить вводные, она автономно пойдет генерировать и выдаст результат. Но на выходе это все еще классический AI-слоп. Структура, смысловые акценты, визуал - все мимо тех требований к качеству, которые нужны в реальности. Автономии добавилось, но финальный результат все равно руками пересобирает человек.
Отсюда вопрос: а есть ли вообще смысл обычному спецу гоняться за топовыми тирами и переплачивать за них?
Моя основная рабочая среда - экосистема Google. При этом Gemini Pro не обновлялась с февраля, весь фокус шел на Flash. И знаете что? Я вообще от этого не страдаю. Закрываю на быстрых моделях практически весь пул повседневных рабочих задач.
По моим субъективным ощущениям, умная модель мне вообще не нужна нигде, кроме написания кода. И тут важная деталь: в коде я как раз не являюсь профильным специалистом. Вот там на контрасте иногда действительно хочется условный Opus или Fable, чтобы закрыть пробелы в моей экспертизе. Но нужен ли он мне каждый день? Нет. Раз в 3-4 месяца, когда надо - покупаю подписку. Но платить за это лишние 100 баксов на постоянке нет никакого смысла. А в тех сферах, где я профи, мне за глаза хватает того, что у меня сейчас есть.
Парадокс в том, что в логике human-in-the-loop избыточная "умность" и автономность флагманских моделей часто играет в минус
1. Модель уходит в долгие размышления, долго что-то собирает, а результат все равно надо переделывать. На быстрой модели через короткие итерации до нужного качества доходишь в разы быстрее.
2. Постоянно упираешься в лимиты запросов. Времени уходит больше, выхлопа - ноль.
Вся эта гонка путает два разных понятия: эрудицию и профессионализм.
Свежие LLM невероятно эрудированны. Но поиск Google тоже знает больше любого человека в мире, однако профессионалом от этого не становится.
Представьте сильного спеца в своей области. А рядом посадите условного Анатолия Вассермана. Вассерман знает факты обо всем на свете, отлично ориентируется и складно говорит. Но если дать ему прикладную рабочую задачу - профи сделает ее в разы лучше. Вассерману просто не хватит практической насмотренности, контекста и профессиональной интуиции.
Сегодняшние топовые LLM - это именно такой цифровой Вассерман. Крутой эрудит, которому все еще нужен реальный специалист рядом, чтобы работа не превращалась в красивый, но бесполезный слоп.
Post #672
245
- 🔥 3
- ❤ 2
- 👍 2