Post #1863
393

⚡️⚡️⚡️На днях на конференции ECCV (European Conference on Computer Vision) 2026 Янн Лекун (Yann LeCun) один их "крестных отцов" глубокого обучения выступил с программным докладом «World Models: Enabling the next AI revolution».
🧠 Главный тезис: LLM — это тупик для сильного AI (AGI)
🔹Лекун начинает с радикального заявления: современный ИИ «далеко не всё» (AI sucks). Он подчёркивает, что нынешние системы, включая большие языковые модели (LLM), не способны достичь человеческого уровня интеллекта, потому что они обучаются исключительно на тексте. Он приводит убийственный аргумент: объём данных, который получает человеческий ребёнок за первые четыре года жизни через зрение и осязание, примерно равен всему объёму публичных текстов в интернете (около 10¹⁴ байт). Текст — это слишком бедный канал для понимания мира.
📉 Почему LLM не понимают мир
🔹Лекун объясняет, что LLM работают через «предсказание следующего токена» — пассивную реакцию без внутреннего (рассуждения). Они компенсируют это «цепочкой рассуждений» (Chain of Thought), но это лишь увеличивает вычисления, не создавая понимания. В реальном мире, где проверка результата требует времени и физического взаимодействия, такой подход не работает.
🌍 Что такое «внутренняя модель мира»
🔹Ключевая концепция презентации — (World Model). Это система, которая, получив текущее состояние мира и действие, предсказывает, каким мир станет после этого действия. Это позволяет ИИ «проигрывать» сценарии и планировать, а не просто реагировать. Лекун называет это System 2 — осознанным, требующим усилий мышлением, в отличие от рефлекторного System 1.
🚫 Почему «предсказание пикселей» — ложный путь
🔹Лекун категорически отвергает идею, что генеративные модели, предсказывающие пиксели могут стать основой для настоящего ИИ. Он называет это ложной проблемой. Причина: следующая картинка в видео зависит от информации, которой нет в текущем кадре. Предсказать это невозможно, поэтому модели выдают размытые, усреднённые результаты.
🧩 Решение: Архитектура JEPA
🔹Вместо этого Лекун предлагает JEPA (Joint Embedding Predictive Architecture). Вместо предсказания пикселей модель учится предсказывать в абстрактном пространстве представлений, отбрасывая всё непредсказуемое и неважное (например, движение каждой травинки). Это похоже на то, как физика использует идеальный газовый закон, не моделируя каждую молекулу. Главная сложность — «коллапс» (модель может просто выучить константы), но Лекун предлагает решение через регуляризацию (методы VICReg, SIGReg).
🛡️ Безопасность и практические советы
🔹Новая архитектура, по мнению Лекуна, позволяет встроить безопасность на уровне конструкции (hardwire) через «барьеры» (guardrails) — целевые функции, которые система обязана соблюдать, чтобы не навредить. В финале он даёт три «еретических» совета коллегам:
1. Забыть про генеративные модели в пользу joint-embedding архитектур.
2. Не тратить силы на LLM, если цель — человекоуровневый ИИ.
3. Использовать обучение с подкреплением с умом — только когда планирование не даёт результата, для корректировки модели мира.
🔹Лекун не говорит, что LLM бесполезны — они хороши для кода и текста. Но они не станут основой для AGI, потому что не понимают физический мир. ⚡️⚡️⚡️Его выступление — это призыв к смене парадигмы: от «предсказания слов» к «построению внутренней модели реальности».
✅Так что капиталистический нюх Трампа не подводит. На Open AI с их LLM моделью свет клином не сошёлся.. это тупиковый путь судя по данному докладу.
Аналитика ЕГ в MAX
🧠 Главный тезис: LLM — это тупик для сильного AI (AGI)
🔹Лекун начинает с радикального заявления: современный ИИ «далеко не всё» (AI sucks). Он подчёркивает, что нынешние системы, включая большие языковые модели (LLM), не способны достичь человеческого уровня интеллекта, потому что они обучаются исключительно на тексте. Он приводит убийственный аргумент: объём данных, который получает человеческий ребёнок за первые четыре года жизни через зрение и осязание, примерно равен всему объёму публичных текстов в интернете (около 10¹⁴ байт). Текст — это слишком бедный канал для понимания мира.
📉 Почему LLM не понимают мир
🔹Лекун объясняет, что LLM работают через «предсказание следующего токена» — пассивную реакцию без внутреннего (рассуждения). Они компенсируют это «цепочкой рассуждений» (Chain of Thought), но это лишь увеличивает вычисления, не создавая понимания. В реальном мире, где проверка результата требует времени и физического взаимодействия, такой подход не работает.
🌍 Что такое «внутренняя модель мира»
🔹Ключевая концепция презентации — (World Model). Это система, которая, получив текущее состояние мира и действие, предсказывает, каким мир станет после этого действия. Это позволяет ИИ «проигрывать» сценарии и планировать, а не просто реагировать. Лекун называет это System 2 — осознанным, требующим усилий мышлением, в отличие от рефлекторного System 1.
🚫 Почему «предсказание пикселей» — ложный путь
🔹Лекун категорически отвергает идею, что генеративные модели, предсказывающие пиксели могут стать основой для настоящего ИИ. Он называет это ложной проблемой. Причина: следующая картинка в видео зависит от информации, которой нет в текущем кадре. Предсказать это невозможно, поэтому модели выдают размытые, усреднённые результаты.
🧩 Решение: Архитектура JEPA
🔹Вместо этого Лекун предлагает JEPA (Joint Embedding Predictive Architecture). Вместо предсказания пикселей модель учится предсказывать в абстрактном пространстве представлений, отбрасывая всё непредсказуемое и неважное (например, движение каждой травинки). Это похоже на то, как физика использует идеальный газовый закон, не моделируя каждую молекулу. Главная сложность — «коллапс» (модель может просто выучить константы), но Лекун предлагает решение через регуляризацию (методы VICReg, SIGReg).
🛡️ Безопасность и практические советы
🔹Новая архитектура, по мнению Лекуна, позволяет встроить безопасность на уровне конструкции (hardwire) через «барьеры» (guardrails) — целевые функции, которые система обязана соблюдать, чтобы не навредить. В финале он даёт три «еретических» совета коллегам:
1. Забыть про генеративные модели в пользу joint-embedding архитектур.
2. Не тратить силы на LLM, если цель — человекоуровневый ИИ.
3. Использовать обучение с подкреплением с умом — только когда планирование не даёт результата, для корректировки модели мира.
🔹Лекун не говорит, что LLM бесполезны — они хороши для кода и текста. Но они не станут основой для AGI, потому что не понимают физический мир. ⚡️⚡️⚡️Его выступление — это призыв к смене парадигмы: от «предсказания слов» к «построению внутренней модели реальности».
✅Так что капиталистический нюх Трампа не подводит. На Open AI с их LLM моделью свет клином не сошёлся.. это тупиковый путь судя по данному докладу.
Аналитика ЕГ в MAX
- 🔥 4










