🤖 Від генерації відео до нейронних ОС: як Runway будує моделі світу
👤 Анастасіс Германідіс – співзасновник і CTO Runway (платформа для генерації та редагування відео за допомогою ШІ)
🎤 swyx (Шон Ванг) та Стівен Вібху – автори Latent Space (подкаст і спільнота про інженерію та дослідження ШІ)
📺 Latent Space – 👥 183 тис. підписників
⏱ 1 год 38 хв
🗓 25.09.26 (1 день тому)
👁 5,7 тис.
📝 Співзасновник Runway Анастасіс Германідіс розповідає про шлях від ранніх інструментів редагування відео до моделей світу (World Models), застосування ШІ у робототехніці та створення інтерфейсів, які повністю рендеряться нейромережами замість класичного коду.
━━━━━━━━━━━━━━━
💡 ГОЛОВНІ ТЕЗИ
1️⃣ Gen-2 виник як випадковий хак вихідного дня
Команда не могла напряму запустити text-to-video. Анастасіс за вікенд зібрав пайплайн: модель генерувала карту глибини з тексту, а Gen-1 перетворював її на відео.
2️⃣ OpenAI Sora ледь не спричинила кризу, але прискорила Runway
Після релізу Sora інтернет ховав Runway. Команда відповіла повною перебудовою інфраструктури, масштабувала обчислення у 10 разів і випустила Gen-3 за три місяці.
3️⃣ Масштабування відеомоделей самостійно вчить фізику світу
Германідіс переконаний: закони масштабування працюють для відео так само, як для тексту. Бенчмарк Physics-IQ показує, що з ростом комп'юту моделі автоматично краще розуміють закони оптики та динаміки.
4️⃣ Відеомоделі замінять класичні симулятори в робототехніці
Замість місяців 3D-сканування оточення достатньо одного фото: модель GWM Robotics генерує правдоподібну симуляцію для перевірки дій роботів набагато швидше за реальне залізо.
5️⃣ Відео від третьої особи – головне паливо для навчання роботів
Дані телеоперацій складно масштабувати. Навчання на звичайних відео з людьми з інтернету з подальшим коротким тюнінгом дає кращу генералізацію для фізичних дій.
6️⃣ Інтерфейсні моделі світу рендерять UI без HTML та CSS
Runway тестує софт, де кожен піксель і кнопка генеруються нейромережею на льоту у реальному часі зі швидкістю 24 кадрів на секунду у відповідь на кліки.
7️⃣ Кінцева мета генеративного ШІ – повністю нейронна ОС
Замість жорстких інтерфейсів користувач взаємодіятиме з динамічною нейромережевою системою, яка адаптує візуальний простір та логіку під контекст завдання.
8️⃣ «Тест на усвідомлений сон» визначить зрілість симуляторів
Анастасіс запропонував власний Тюрінг-тест: якщо людина в VR-шоломі не зможе відрізнити наскрізний відеопотік від нейромережевого рендеру кімнати в реальному часі, модель світу досягла успіху.
💬 «Фінальний етап моделей світу для інтерфейсів – це повністю нейронна операційна система.»
🎯 ЩО З ЦИМ РОБИТИ
Сприймайте генерацію відео не як медіа-іграшку, а як універсальний симулятор реальності: наступна хвиля автоматизації інтерфейсів та роботів спиратиметься на пікселі, а не на код.
💵 0.13$
@icereadspodcastsua
Post #255
393
- ❤ 2
- 😱 1