TGViewer
КПД КПД @quant_prune_distill · 3.49K subscribers
Post #521 2.16K
🧪Эксперименты

Модельку валидируют на наборе text-2-image и editing бенчмарков. Qwen-Image выдает сильные результаты на GenEval, DPG, в целом опережая опенсорс и даже GPT-Image. На задачах рендеринга текста околосотовый результат на английском и разрывной на китайском (+100500 social credits).

На instruction датасетах вроде бы все тоже очень здорово. Везде не уступает (якобы) GPT-Image опять же с большим разрывом на китайском.

Дообученный VAE демонстрирует лучший PSNR/SSIM (чтобы это ни значило) по сравнению с конкурентными автокодировщиками. Причем разница особенно заметна на текстах.

Еще оно может в детекцию, novel view synthesis и прочие задачи.

💡 Выводы

Очередной качественный опенсорс от китайцев 🇨🇳 💪. Прямо чего-то фундаментального нового, прорывного нет, но видна кропотливая аккуратная работа с использованием всех лучших практик из научной литературы.
  • 🔥 7
  • 👏 2
More from @quant_prune_distill
  1. Oct 7, 2026А еще есть красивая демка
  2. Oct 7, 2026⚙️ Метод MMD есть мера различия между двумя распределениями P, Q. Задается некоторый полож…
  3. Oct 7, 2026🧠 Representation-Space MMD for Diffusion Language Models 📄 Статья Первое, что приходит в…
  4. Oct 7, 2026А вообще, можно энкодить все на языке brainfuck и иметь Тьюринг-полную систему.
  5. Oct 7, 2026Jev не генеративен, потому что он не выбирает следующий токен, а выбирает один из варианто…
  6. Oct 6, 2026Совпадение? Не думаю!
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →