«Системный Блокъ» — издание о цифровых технологиях в культуре, искусстве, образовании и обществе.
Финалист премии «Просветитель»
sysblok.ru
vk.com/sysblok
fb.com/sysblok
instagram.com/sysblok/
Присоединяйтесь к команде: sysblok.ru/join
Post #1269
3.03K
Браузер от OpenAI, DeepSeek предлагает заменить текст картинками
Рассказываем, что произошло в мире ИИ за последнее время.
Браузер от OpenAI
Компания OpenAI представила браузер ChatGPT Atlas со встроенными ИИ-функциями.
Во время посещения веб-сайтов пользователь может задавать вопросы ChatGPT, который будет использовать содержимое страницы как контекст. Например, находясь на сайте отеля, у чат-бота можно узнать о ближайших достопримечательностях. Модель также способна автономно выполнять задачи вроде сборки заказа по предоставленному списку или заполнения таблиц.
Ещё одна функция — умный поиск по истории браузера. В целях безопасности агенту запрещено скачивать файлы и исполнять код. На определённых сайтах при выполнении задач систем будет требовать ручного подтверждения потенциально опасных действий — например, денежных переводов. Кроме того, пользователь может вручную запретить ChatGPT доступ к выбранным страницам.
ChatGPT Atlas доступен для пользователей Mac. Количество запросов зависит от типа подписки.
Новый способ подачи текста языковой модели от DeepSeek
Лаборатория DeepSeek предложила представлять текст для языковых моделей в виде изображения.
Обычно текст разбивают на токены — слова или их фрагменты. У этого подхода есть недостатки: одна фраза может разбиваться по-разному, качество разбиения хуже для неанглийских языков, а эффективность сжатия низкая — один токен соответствует лишь 2–3,5 символам. При обработке длинных текстов модель начинает забывать контекст, а потребление памяти растёт.
Изображения разбиваются на «визуальные» токены: картинку делят на квадраты 16×16 пикселей. Такие токены можно агрегировать, сжимая последовательность в несколько раз без потери информации.
DeepSeek применили этот подход к тексту: представили его как изображение и преобразовали в визуальные токены.
Эксперименты показали, что это позволяет уменьшить длину последовательности в 10 раз (по сравнению с текстовым представлением) без ущерба качеству. Даже при сжатии в 20 раз модель сохраняет 60% исходного качества.
🤖 «Системный Блокъ» @sysblok
Рассказываем, что произошло в мире ИИ за последнее время.
Браузер от OpenAI
Компания OpenAI представила браузер ChatGPT Atlas со встроенными ИИ-функциями.
Во время посещения веб-сайтов пользователь может задавать вопросы ChatGPT, который будет использовать содержимое страницы как контекст. Например, находясь на сайте отеля, у чат-бота можно узнать о ближайших достопримечательностях. Модель также способна автономно выполнять задачи вроде сборки заказа по предоставленному списку или заполнения таблиц.
Ещё одна функция — умный поиск по истории браузера. В целях безопасности агенту запрещено скачивать файлы и исполнять код. На определённых сайтах при выполнении задач систем будет требовать ручного подтверждения потенциально опасных действий — например, денежных переводов. Кроме того, пользователь может вручную запретить ChatGPT доступ к выбранным страницам.
ChatGPT Atlas доступен для пользователей Mac. Количество запросов зависит от типа подписки.
Почему это важно?
Многие компании разрабатывают продукты для автоматизации поиска и выполнения задач в интернете. Google встроила языковую модель Gemini в браузер Chrome, Perplexity выпустила ИИ-браузер Comet.
Высокий интерес к этой области объясняется тем, что люди решают огромное количество задач онлайн. Получая доступ к информации о посещаемых сайтах и действиях на них, компании лучше понимают потребности и интересы пользователей. Это открывает возможности как для улучшения продуктов, так и для монетизации.
Например, ChatGPT потенциально сможет встраивать релевантную рекламу в ответы, основываясь на контексте просматриваемой страницы. Компании также могут собирать историю взаимодействия с различными сайтами для обучения своих агентов.
Новый способ подачи текста языковой модели от DeepSeek
Лаборатория DeepSeek предложила представлять текст для языковых моделей в виде изображения.
Обычно текст разбивают на токены — слова или их фрагменты. У этого подхода есть недостатки: одна фраза может разбиваться по-разному, качество разбиения хуже для неанглийских языков, а эффективность сжатия низкая — один токен соответствует лишь 2–3,5 символам. При обработке длинных текстов модель начинает забывать контекст, а потребление памяти растёт.
Изображения разбиваются на «визуальные» токены: картинку делят на квадраты 16×16 пикселей. Такие токены можно агрегировать, сжимая последовательность в несколько раз без потери информации.
DeepSeek применили этот подход к тексту: представили его как изображение и преобразовали в визуальные токены.
Эксперименты показали, что это позволяет уменьшить длину последовательности в 10 раз (по сравнению с текстовым представлением) без ущерба качеству. Даже при сжатии в 20 раз модель сохраняет 60% исходного качества.
Почему это важно?
Исследователи уже давно пытаются заменить процесс разбиения текста на символьные токены более универсальными и надежными способами. Решение этой задачи поможет повысить качество работы LLM не в одной конкретной области, а во всех сразу, поскольку языковые модели оперируют токенами как фундаментальными строительными блоками.
Методы, позволяющие более компактно представлять текст, особенно актуальны для эффективной работы с длинными документами. Способность обрабатывать объемные тексты необходима для применения LLM в задачах анализа больших массивов данных — например, архивных материалов или кодовых баз. Кроме того, это важно для разработки ИИ-агентов, которые на каждом промежуточном шаге выполнения задачи генерируют развернутые рассуждения.
🤖 «Системный Блокъ» @sysblok
- 🔥 18
- ❤ 12
- 👍 8
- 🤔 3






