TGViewer
Системный Блокъ Системный Блокъ @sysblok · 11.6K subscribers
Post #908 3.88K
Две новых языковых модели и обучающая выборка в 15 триллионов токенов: дайджест новостей из мира ИИ

Компания Snowflake выпустила самую большую языковую модель, открытую для коммерческого использования. Разработчикам доступна новая обучающая выборка из 15 триллионов токенов. Microsoft представила новое поколение компактной модели Phi. Рассказываем, что произошло в мире ИИ на прошлой неделе.

Доступна обучающая выборка с 15 триллионами токенов

Опубликована новая выборка текстов для обучения языковых моделей — FineWeb. Она содержит отфильтрованные англоязычные тексты разных веб-сайтов и покрывает период с лета 2013 года до начала весны 2024 года. Мультиязычную версию обещают выложить в ближайшее время. Всего в выборке 15 триллионов токенов (это часть слова или слово). Для проверки качества данных на части выборки было обучено несколько языковых моделей. Их качество получилось выше, чем у тех, которые обучали на других известных наборах данных (C4, Pile, Dolma и другие).

Новая самая большая публичная LLM

Компания Snowflake выпустила языковую модель Arctic с 480 миллиардами параметров. Модель использует архитектуру Mixture of Experts. Иными словами, в процессе её работы задействована только часть всех параметров (какая именно — модель выбирает в зависимости от входных данных). В случае Arctic используется всего лишь 3,5% параметров. По качеству она сопоставима с LLama 3 70B. На данный момент Arctic — самая большая модель, которую можно использовать в коммерческих целях без каких-либо ограничений.

Phi-3 — маленькая, но умная языковая модель

Компания Microsoft выпустила третье поколение своих компактных языковых моделей Phi. Модель Phi-3 выделяется относительно небольшим размером: 3,8 миллиарда параметров (для сравнения самая большая на текущий момент публичная модель в 126 раз больше) и высокими показателями в основных тестах. По качеству она сопоставима с недавно вышедшей LLama 3 с восемью миллиардами параметров. По заявлениям Microsoft, этого удалось достичь с помощью обучения модели на данных высокого качества: часть данных — сильно отфильтрованный набор текстов из интернета, другая часть — данные, сгенерированные с помощью GPT-4. Однако в сообществе исследователей и разработчиков некоторые относятся к возможностям Phi-3 скептически: критики подозревают, что в обучающих данных присутствовали тексты, на которых её впоследствии тестировали. Такие же дискуссии вызвали и её предшественники, Phi-1 и Phi-2.

🤖 «Системный Блокъ» @sysblok
huggingface.co HuggingFaceFW/fineweb · Datasets at Hugging Face We’re on a journey to advance and democratize artificial intelligence through open source and open science.
  • 🔥 19
  • ❤ 7
  • 👍 4
More from @sysblok
  1. Oct 8, 2026«Системный Блокъ» выбирает слово года вместе с «Грамотой» Портал «Грамота» в четвертый раз…
  2. Oct 7, 2026Марш энциклопедистов: легендарная вселенная профессора Фортрана вчера и сегодня Как детска…
  3. Oct 5, 2026Тест: угадайте, что отправители писали на старых открытках До появления социальных сетей о…
  4. Oct 1, 2026От рок-баллад до Тейлор Свифт: как алгоритмы находят сюжеты в песнях 1 октября мир отмечае…
  5. Sep 30, 2026Пользователи применяли Claude для слежки и кибератак В новом отчете Anthropic рассказала,…
  6. Sep 25, 2026Минпросвещения составило правила для учителей по работе с ИИ Ведомство рекомендует школам…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →