TGViewer
Анализ данных (Data analysis) Анализ данных (Data analysis) @data_analysis_ml · 51.2K subscribers
Post #4968 5.32K
Исследователи из Национального университета Сингапура представили DMax: новый подход для diffusion LLM.

Вместо последовательного вывода токенов модель генерирует их параллельно, но при этом не разваливается по качеству

Ключевая идея - превратить декодирование в процесс самокоррекции.

Модель не просто пишет ответ, а постоянно пересматривает и исправляет свои же предсказания прямо по ходу генерации.

Это решает главную проблему параллельной генерации - накопление ошибок

По цифрам:

• DMax заметно обгоняет LLaDA-2.0-mini
• TPF на GSM8K вырос с 2.04 до 5.47
• на MBPP с 2.71 до 5.86
и всё это без потери точности

Скорость - до 1338 токенов в секунду на H200

Paper: https://huggingface.co/papers/2604.08302
Code: https://github.com/czg1225/DMax
Models: https://huggingface.co/collections/Zigeng/dmax-models
Datasets: https://huggingface.co/collections/Zigeng/dmax-training-data
  • 👍 13
  • 🔥 11
  • ❤ 7
More from @data_analysis_ml
  1. Oct 8, 2026🧮 Математика для ИИ на русском: от школьной базы до трансформеров и диффузии Бесплатный к…
  2. Oct 8, 2026🤖 ИИ-агентам убрали «начальника», и сложные задачи стали решаться быстрее. Исследователи…
  3. Oct 7, 2026🏦 ИИ-агенты могут лишить банки США преимущества стоимостью $500 млрд Механизм простой: аг…
  4. Oct 7, 2026🧮 Три часа вычислений на математический результат: самая неожиданная цифра в релизе OpenA…
  5. Oct 7, 2026📌 OpenAI выложила 722 математические работы своей внутренней модели Все статьи написала в…
  6. Oct 7, 2026🔎 Looped-модели научились экономить память: качество 12 блоков при KV-кэше на 4 Looped-мо…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →