Мы начинаем выходить за пределы территории, где LLM протестировали бы, например, запросом "создай SVG пеликана на велосипеде". В качестве одной из идей обобщения мне стало интересно, что сделает Opus 5, если я дам ей первый абзац "Властелина колец", бюджет в 1 млн токенов (~$10) и попрошу сделать 3D-рендер на Three.js.
Opus ушла в себя примерно на 2 часа и написала 5500 строк кода, который (процедурно) визуализировал историю. Получилось немного коряво, но весело. Однако сам факт того, что LLM должна размещать и организовывать различные полигональные ассеты в координатах $(x, y, z)$ и писать код, который всё это анимирует, просто поражает — как и то, что это вообще работает.
Мне также нравятся подобные примеры, потому что ни один человек в здравом уме никогда не стал бы тратить время на написание чего-то настолько специфического. Но у LLM есть вся выносливость и терпение мира, так что это пример того, как мы переходим от "никто и никогда бы этого не сделал" к "конечно, почему бы и нет, это же почти бесплатно". Подобных сценариев может быть намного больше. И меня очень вдохновляет идея создания гиперкастомных миров, в которые можно погружать игроков — например, чтобы поучаствовать в сюжете "Властелина колец" в качестве NPC-наблюдателя, одного из персонажей и т.д. Что-то вроде эфемерой GTA по любому запросу.
Последняя мысль заключается в том, что сфера миров и игр обнажает слабое место LLM: они не могут легко проверять свою работу, поскольку пока не способны эффективно и «нативно» воспринимать видео или играть внутри них. В данном случае Opus 5 приходилось очень медленно и кропотливо делать скриншоты в разных точках, из-за чего она несколько раз ошибалась и создала кучу "багов". Это пример базовых возможностей (мультимодальность, геймплей), которых, на мой взгляд, всё ещё сильно не хватает.
Post #812
300
А что если дать ИИ 10 долларов, первый абзац Властелина кольца и попросить сделать на основе него мультик? Так Андрей Карпати тестирует своих ИИ ассистентов. Его пост ниже.