TGViewer
я обучала одну модель я обучала одну модель @def_model_train · 4.48K subscribers
Post #990 4.69K
я обучала одну модель Невероятно, но гугл не отложили релиз Gemini на следующий год* 🥳 https://blog.google/technology/ai/google-gemini-ai/ Обходит сейчас GPT-4 на всех бенчах, кроме HellaSwag Проскимила технический репорт, и увы про архитектуру не сказано почти ничего, кроме…
Спустя пару дней у всех появилось больше времени почитать репорт и посмотреть демки, и общее впечатление от модели кажется начало у всех портиться

Не успела написать об этом раньше эйай ньюс, но гугл уже признали, что видео с демо было почти целиком фейковым, начиная с того, что голосом в реальном времени с Gemini никто не общался, и озвучку наложили позже. И наложили конечно на черрипикнутые фреймы. А еще что в видео прозносятся не те промпты, которые использовались при генерации ответа (вот про это более подробный твит). Например, в видео на моменте с дизайном машин произносили:
> Narrator: "Based on their design, which of these would go faster?'
А реальный промпт был:
> Real Prompt: "Which of these cars is more aerodynamic? The one on the left or the right? Explain why, using specific visual details."

В статье от Bloomberg рассказывают, что контрибуторам это тоже не понравилось и они начали распространять во внутренних чатиках ироничные мемы про эту демку (получается их подставили маркетологи?)

Второй консерн это бенчмарки. На многих из них отрыв от GPT-4 очень маленький, но особое внимание акцентировалось на MMLU, где он заметный. Плюс, Gemini заявлялась как первая модель, которая на нем превзошла уровень человеческих экспертов

Так вот, Gemini Ultra действительно лучше проходит MMLU с 32 chain-of-thought примерами – то есть, когда она генерит 32 варанта решения через chain-of-thought и выбирает лучший. Но на 5-shot промптинге выигрывает-то все равно GPT-4, когда такой сеттинг так-то сложнее 🤡 А в аппендиксе вообще сказано, что и по CoT@32 выигрывала тоже GPT-4, но вот с еще одним дополнительным косылем Gemini уехала вперед
  • ❤ 24
More from @def_model_train
  1. Mar 28, 2026Моя любимая текущая конспирологическая теория из твиттера: claude mythos настолько силен в…
  2. Mar 12, 2026За неделю вышло несколько интересных новостей на стыке ML и нейробиологии: я про экспериме…
  3. Mar 8, 2026Другая поразившая меня часть этой хроники – это очень необычное понимание того, что такое…
  4. Mar 8, 2026Если вы еще не устали за неделю читать про противостояние Антропика и DoD, то я могу вам п…
  5. Mar 2, 2026Юдковский наконец-то победил в своей борьбе, и искусственный интеллект решил сам разбомбит…
  6. Nov 27, 2025Я в целом согласна с оценкой, что Суцкевер в своем интервью выдал примерно 3 бита информац…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →