TGViewer
Градиент обреченный Градиент обреченный @doomgrad · 8.79K subscribers
Post #589 5.93K
🔺 Парад LLM

За последний месяц как из рога изобилия вышло много полезных и не очень языковых моделей. Соберем в один пост.

🔸 Llama 3.1

Линейка из трех моделей 405B, 70B и 8B параметров. Есть детальный отчет об обучении, модель нативно учили под 8 языков (русского среди них нет, поэтому может ошибаться в грамматике) и использование внешних тулов.

Кроме основных моделей выпустили Llama Guard 3 и Prompt Guard для классификации вредоносных промптов и генераций.

HF | пост | тех. репорт | чат с моделью

🔸 Mistral Large 2

123B параметров и много языков, включая русский. Опять же, есть способности по вызову внешних функций. Заявляют качество на уровне GPT-4o и Claude 3 Opus. Веса также выложили на HF.

А еще в честь 2311-й годовщины Архимеда выпустили MathΣtral, 7B модель с улучшенными способностями в математике; и Codestral Mamba для анализа кода. Новая архитектура позволяет работать с увеличенным контекстом, пишут, что тестили на 256k токенов.

HF | Пост | чат с моделью

🔸 Mistral NeMo

Снова Мистраль, но на этот раз 12B и в сотрудничестве с NVIDIA. Мультиязычная (есть русский), по замерам авторов бьет недавно вышедшую Gemma 2 9B и Llama 3 8B. Контекст 128k + обновили токенизатор, теперь он гораздо лучше сжимает тексты на 100+ языках.

HF | пост

🔸 Minitron

Модели на 4B и 8B от NVIDIA. Модели получили путем дистилляции и прунинга 15B. Затраченный компьют оценили как в 40 раз меньше, чем обучать такие модели с нуля, сравнимом или лучшем значении MLLU чем у соответствующих по размеру Gemma и Llama.

Про то, как делали, рассказывают в статье.

HF | GitHub | arxiv

🔸 T-lite

Коллеги из Тинькова также поделились моделью. Особых деталей нет, кроме того, что компьют был небольшой, а качество на бенчах как у chatgpt-3.5.

На русском генерирует действительно неплохо для модели такого размера. На вопрос "кто тебя сделал?" отвечает "разработчики из OpenAI", что намекает на необходимость чистки SFT сета.

HF

🔸 Apple DCLM-7B

Да, действительно это модель от Apple. Из интересного, рассказывают про подготовку датасета (DataComp for Language Models), чистку, удаление MMLU из обучения и т.д. Пишут, что пробовали обучаться на 270 подсетах из CC, чтобы найти наиболее "правильное" распределение.

HF | arxiv

🔸 SmolLM

SoTA модели на 135M, 360M и 1.7B параметров непосредственно от HF. Для экспериментов выложили обучающие данные и, по-моему, это самое интересное.

Сделали синтетический сет Cosmopedia v2 и дополнительно пофильтровали 220B токенов из уже почищенного-перечищенного датасета FineWeb Edu.

Модельки маленькие, можно запускать локально, выложили ONNX версии и демку для запуска прямо в браузере (загружается 172Mb весов).

HF | пост | SmolLM-Corpus | Веб-демо
  • 🔥 32
  • 👍 6
  • ❤ 4
  • ⚡ 1
More from @doomgrad
  1. Oct 1, 2026Сундар Пичаи проанонсировал Gemini 4 Argon. Пишут, что внутри им довольны, используют в ис…
  2. Sep 29, 2026Погонял новый Sonnet, сделал сценку Сити с машинками и NPC. Занимает всё около мегабайта,…
  3. Sep 29, 2026AMD покупает World Labs Стартап от Фей Фей Ли из области моделей мира (это когда ИИ оперир…
  4. Sep 29, 2026Опять 5.5 Вышел Sonnet 5.5. В пресс-релизе сумели нарисовать график, где он выше всех. Обо…
  5. Sep 22, 2026Чувак говорит, что при общении с новым чат-ботом от Meta тот скинул ему архив своей файлов…
  6. Sep 22, 2026Опа, подарочки. Ждём три ресета от Codex’а.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →