Как ИИ научился пользоваться компьютером и почему интернет к этому не готов — лучшие статьи ноября 2025
Под новый год подготовил сразу два обзора ИИ-исследований. Давайте сначала разберем первый: “неожиданно” выяснилось, что интернет и интерфейсы проектировались для людей, а не для автономных агентов. Но мы видим первые системные попытки научить ИИ действовать в общей информационной среде вместе с людьми.
1. Будущее программирования — мультимодальное: как JanusCoder научился видеть интерфейс, который сам создает
ИИ пишет код для интерфейсов, но не сверяется с полученным результатом. JanusCoder объединил текст и изображение в один пайплайн: ИИ запускает код, видит получившийся интерфейс в виде картинки и сравнивает ее с ожидаемым результатом. Теперь разработка интерфейсов – это цикл мультимодальной самопроверки.
🔍 Обзор статьи | 📜 Полная статья | 💾 Код
2. От пикселей к смыслу: как SVG помогает ИИ понимать мир
ИИ “понимает” пиксельные изображения. Но пиксели не позволяют глубоко понять смысл картинки. Если перевести изображения в SVG-формат, то они становятся более читаемой структурой для ИИ-агентов, позволяя им лучше рассуждать с помощью картинок.
🔍 Обзор статьи | 📜 Полная статья | 💾 Код
3. Почему мышление через видео может быть следующим шагом в развитии ИИ
ИИ научился рассуждать с помощью картинок. Но что насчет видео? Теперь ИИ умеет строить гипотезы, проверять их действиями и корректировать их прямо в видеопотоке, решая более сложные пространственные и логические задачи.
🔍 Обзор статьи | 📜 Полная статья | 💾 Код
4. Как обучить ИИ работать за компьютером
Разработчики использовали реальные интерфейсы и жестко связали язык с элементами интерфейса. Даже малые модели начинают точно попадать в кнопки. Поэтому связь слов с интерфейсом решает больше размера модели.
🔍 Обзор статьи | 📜 Полная статья
5. Как универсальный ИИ-агент учится жить в открытом мире
Агент Lumine использует мышь и клавиатуру, а рассуждает только при необходимости. Он часами выполняет цели в открытых игровых мирах и переносит навыки без дообучения — так ИИ научился выживать в полной неопределенности.
🔍 Обзор статьи | 📜 Полная статья
6. Как ИИ-ученый пишет научные статьи о машинном обучении на уровне джуна
Младший научный ИИ-сотрудник действительно улучшает статьи, проверяет код и эксперименты. Качество итогового результата растет, но старший научный сотрудник-человек все равно остается необходим.
🔍 Обзор статьи | 📜 Полная статья | 💾 Код
7. Как ИИ-агенты научились рефакторить код: что получается хорошо, а что не очень
Агенты берут на себя чистку кода: переименования файлов и разбиение методов. Но архитектуру они не трогают — и это нормально. Поэтому ею должны заниматься люди, а чистку кода уже можно отдать машинам.
🔍 Обзор статьи | 📜 Полная статья | 💾 Код
8. Как ИИ-агенты живут в «Станции» и делают научные открытия
Агенты для исследований живут в специальной среде с памятью, историей и свободой выбора. Так рождаются новые прорывные идеи, а среда для агентов значит даже больше, чем архитектура мультиагентной системы.
🔍 Обзор статьи | 📜 Полная статья | 💾 Код
9. Как писать README-файлы для ИИ-агентов
README-файлы теперь пишут и для агентов: что можно менять в коде, а что нельзя. Это новый слой управления ИИ-агентами и относиться к нему нужно как к коду, иначе автономность обгонит контроль.
🔍 Обзор статьи | 📜 Полная статья | 💾 Код
10. Как сделать интернет удобным для ИИ-агентов
Давайте вместо того, чтобы агенты угадывали пиксели на экране, зададим им явные описания действий и состояний интерфейса. Тогда агенты смогут работать в интернете более надежно. Это первый системный шаг к общему интернету для людей и ИИ.
🔍 Обзор статьи | 📜 Полная статья
В прошлом месяце ИИ научился видеть интерфейсы и достигать целей в неопределенной среде. Среда – главный барьер для агентов. Следующий шаг: переустройство интерфейсов и интернета как общей информационной среды для людей и агентов.
👉 Подробный обзор
#исследования
Post #273
2.35K