Что: Урожай из 7 моделей с открытыми весами: от флагмана DeepSeek до музыкального генератора YuE2
Ссылки: DeepSeek-V4.1-Flash, GigaChat 3.5 Reasoning, AliceAI-T5-35B-A0.6B, YuE2-3B, GLM-5.3-CYBERSECURITY-FP8, DeepSeek-V4.1-Flash-UNCENSORED-FP8, Qwen3.8-27B-Uncensored-Cyber-agentic-GGUF
Почему интересно: DeepSeek-V4.1-Flash - главный релиз прошлой недели. 552 млрд параметров MoE (8 млрд активных на префилле и 16 млрд на декоде), контекст до 1 млн токенов, MIT-лицензия. Главная фишка в агрессивном сжатии KV-кэша через Compressed Sparse Attention 2 (890 байт на токен, что в 4 раза меньше предшественника, а persistent-кэш ужат до 8 раз!). Для агентных задач с длинным контекстом это может быть большим шагом вперёд по стоимости инференса. Бенчмарки: 74.2 на Terminal-Bench 3.0, 54.8 на CyberGym, т.е. до Opus 5 не дотягивает, но крайнеплотно.
GigaChat 3.5 Reasoning - это, похоже, первая полностью российская открытая модель с полноценным режимом рассуждений. 432 млрд MoE (28 млрд активных), кастомная гибридная архитектура MLA + GatedDeltaNet, контекст 262 тыс. токенов. Обучали через online RL с шестью доменными экспертами: STEM, код, код-агент, general-агент, диалог и soft skills. Для задач, где нужно строгое рассуждение и математика релиз интересный, а вот для агентной разработки есть варианты получше. Также может быть востребовано для RAG или аналитических пайплайнов на русском языке.
AliceAI-T5-35B-A0.6B от Яндекса - узкоспециализированный инструмент для генерации быстрых ответов в поиске. Encoder-Decoder с разреженной MoE, всего 0.6 млрд активных параметров. По качеству сопоставима с Qwen 3.5 35B-A3B, при этом требует значительно меньше вычислений. Открыли только претрейн-веса, прод инференс остался внутри Яндекса. Полезно для тех, кто строит собственный поисковый пайплайн или рекомендательную систему и хочет ускорить расчёт.
YuE2-3B - генератор музыки из Поднебесной, который по бенчмаркам обходит Suno v5 (6.96 против 6.87 на WildSongBench), хотя музыкальные бенчамрки - особый вид искусства. Работает локально на скромном железе (создаёт 3.5-минутные треки за минуту на RTX 5090, требует меньше 9 ГБ VRAM), генерирует 48 кГц стерео, поддерживает редактируемые партитуры и агентное редактирование. Коммерческое использование, увы, запрещено (лицензия CC BY-NC 4.0). Для музыкальных энтузиастов, это, возможно, лучший бесплатный генеративный инструмент на сегодня.
Ну и по традиции, что там со снятием запретов. Ниже представлены нишевые инструменты для red team и пентеста, а не для продакшена 🙂
GLM-5.3-CYBERSECURITY-FP8 и DeepSeek-V4.1-Flash-UNCENSORED-FP8 от dealignai - это расцензуренные (через abliteration) версии соответствующих передовых открытых моделей. Для DeepSeek это дало 100% ASR (attack success rate) при падении MMLU на 4.22 пункта. Для GLM реализовали доменный взлом под кибербезопасность с сохранением FP8 на Hopper.
Qwen3.8-27B-Uncensored-Cyber-agentic-GGUF - расцензуренный форк, на этот раз Qwen 3.8 27B, дообученный на кибербезопасных данных через LoRA.
#eng #opensource #llm #deepseek #gigachat #yue2 #abliteration #aliceai #безопасность #llm #ии
Post #609
75