TGViewer
AbstractDL AbstractDL @abstractdl · 18.6K subscribers
Post #140 3.47K
Flamingo: a Visual Language Model (by DeepMind)

На мой взгляд, это самая многообещающая работа за последнее время. Авторы представили модель, которая способна понимать смесь картинок и текста. Это позволяет решать кучу новых задач во few-shot режиме и даже вести визуальный диалог (см. картинку).

Идея довольно оригинальная — авторы предлагают вставить внутрь замороженной языковой модели (Chinchilla) дополнительные gated cross-attention блоки, которые будут показывать ей фичи от предобученного и замороженного визуального энкодера. А обучаются здесь ТОЛЬКО эти новые cross-attention блоки. В итоге получается языковая модель, с дополнительным вниманием на визуальные фичи картинок, вставленных в текст.

Для обучения собрали новый датасет — MultiModal MassiveWeb (M3W), состоящий из 43М веб-страниц, где картинки и текст идут вперемешку, а ещё к нему подмешивают датасет ALIGN.

Статья, GitHub
  • 👍 29
More from @abstractdl
  1. Sep 22, 2026GPT-6-sol и luna. Куда ещё дешевле то? Демпингуют) UPD: раздали всем reset-ы лимитов
  2. Sep 22, 2026Антропик дропнули сброс лимитов, доступен до 22 октября
  3. Sep 22, 2026Opus-5.5
  4. Sep 21, 2026Grok-4.7
  5. Sep 21, 2026Замечаете, как Codex иногда неожиданно тупеет? Возможно, вместо Astra вам отвечает… Luna.…
  6. Sep 19, 2026Так интересно наблюдать за работой само-координирующегося роя агентов)) Помимо детей и вну…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →