Weekly Data News: смягчение правил по ПДн, GenAI-обучение в ЦБ и новых виток гонки за мультимодальностью
Минцифры смягчило требования к бизнесу по обработке персональных данных. Опубликована новая версия второго пакета антифрод-поправок: бизнесу потребуется направлять на «Госуслуги» не все согласия на обработку ПДн, а только те, которые предусмотрены подзаконными актами.
Кроме того, министерство отказалось от нормы, по которой бизнес мог бы запрашивать согласия на обработку ПДн лишь в случаях, предусмотренных международными договорами РФ или федеральным законом. В случае принятия закон вступит в силу в 2028 году.
Банк России ищет подрядчика для обучения около 500 сотрудников работе с генеративным ИИ, включая навыки формулирования промптов, создания Telegram-ботов и цифровых аватаров. Обучение стартует в I квартале 2026 года и продлится до II квартала 2027 года.
OpenAI привлекла около 100 бывших инвестбанкиров для обучения своих нейросетей финансовым моделям. Компания платит специалистам по 150 долларов в час.
Среди них — экс-сотрудники JPMorgan, Morgan Stanley и Goldman Sachs. Их задача — писать запросы простым языком и создавать финансовые модели для разных типов сделок. Каждую неделю специалисты должны представить как минимум одну модель.
Аналитики Bloomberg считают, что конечная цель этого проекта — создание ИИ-системы, способной заменить младших банкиров.
Билайн запустил бесплатный тест-драйв платформы ИИ-агентов. Компании смогутт самостоятельно протестировать работу ИИ на релевантных для них задачах. Платформа является мультиагентной системой, которая объединяет в себе возможности популярных LLM. Агенты при этом помнят общий контекст запросов и дополняют друг друга.
MWS AI вступила к гонку мультимодальных ИИ-моделей и представила разработку для одновременной работы с изображениями и текстом Cotype VL. Ее можно развернуть в закрытом контуре компании и дообучить на данных заказчика. Модель разработана на базе Qwen 2.5-VL с открытым исходным кодом, содержит 32 млрд параметров и распознает изображения с печатным, рукописным и смешанным текстом. Для обучения был использован датасет из различных доменов, включая финансы, промышленность, IT, телеком и здравоохранение — всего более 150 тыс. документов.
Текст как изображение: DeepSeek представила новую OCR-модель. Она работает не с текстовыми токенами, как традиционные системы, а с визуальными представлениями страниц. Это меняет сам принцип хранения и анализа информации — она не просто распознает текст, а используется для оптического сжатия контекста. В экспериментах показаны впечатляющие результаты — даже при десятикратном сжатии точность остаётся около 97%, а при двадцатикратном около 60%.
Alibaba презентовала новые мультимодальные модели Qwen3-VL-2B и Qwen3-VL-32B — при этом вторая сразу же побила рекорды по производительности, продемонстрировав способность не просто распознавать кадры на видео, но и понимать сюжет и причинно-следственные связи.
Кандидаты на ИТ-вакансии стали массово искажать сведения в своих резюме. По данным HH.ru, разработчики ПО находятся на первом месте — на них указали 20% работодателей. По 15% респондентов упомянули тестировщиков и руководителей проектов, 12% отметили продакт-менеджеров.
Немного реже преувеличенный опыт встречается в резюме системных администраторов и технических писателей (по 10%), датасайентистов, аналитиков и CIO-директоров (по 9%). Руководителей аналитических отделов отметили 8% респондентов. Самые честные — сетевые инженеры и специалисты технической поддержки, про них говорили лишь 3% участников опроса.
Post #109
411
- 👍 4
- 🔥 3