Сегодня ИИ пишет код, но не видит, как он выглядит на экране. Система JanusCoder меняет это, добавляя способность понимать не только текст, но и визуальную часть программирования. Модель может получать текст, изображение или их комбинацию и генерировать код, который на выходе создаст именно тот визуал, который запросили.
JanusCoder — это мультимодальная модель, которая соединяет код с визуальным контентом. Например, ИИ может написать код для графика или анимации и сразу увидеть, как это будет выглядеть на экране.
Основная проблема — это мультимодальные данные: нужно не только описание задачи, но и изображения, скриншоты и результаты кода. Для этого исследователи собирают специальные датасеты, которые включают задачи по графикам, интерфейсам и анимациям, и используют подходы для переноса знаний между разными областями.
Модель использует несколько шагов для улучшения кода:
• Управляемая эволюция — улучшение точности решения
• Реконтекстуализация — переписывание инструкций для точности
• Двунаправленный перевод — перенос решений между программными доменами
Модели обучены на крупнейшем датасете JanusCode-800K, который включает текст и визуальные данные, и способны генерировать или редактировать код с учетом визуального результата. JanusCoder показал отличные результаты на тестах, таких как PandasPlotBench и ArtifactsBench, и превосходит аналогичные модели, например, GPT-4o в области визуализации.
С помощью JanusCoder ИИ может не только генерировать код, но и понимать, как он будет выглядеть в реальном мире. Это изменит работу разработчиков, аналитиков и ученых, создающих визуализации данных.
Data Science
