Спустя пару дней у всех появилось больше времени почитать репорт и посмотреть демки, и общее впечатление от модели кажется начало у всех портиться
Не успела написать об этом раньше эйай ньюс, но гугл уже признали, что видео с демо было почти целиком фейковым, начиная с того, что голосом в реальном времени с Gemini никто не общался, и озвучку наложили позже. И наложили конечно на черрипикнутые фреймы. А еще что в видео прозносятся не те промпты, которые использовались при генерации ответа (вот про это более подробный твит). Например, в видео на моменте с дизайном машин произносили:
> Narrator: "Based on their design, which of these would go faster?'
А реальный промпт был:
> Real Prompt: "Which of these cars is more aerodynamic? The one on the left or the right? Explain why, using specific visual details."
В статье от Bloomberg рассказывают, что контрибуторам это тоже не понравилось и они начали распространять во внутренних чатиках ироничные мемы про эту демку (получается их подставили маркетологи?)
Второй консерн это бенчмарки. На многих из них отрыв от GPT-4 очень маленький, но особое внимание акцентировалось на MMLU, где он заметный. Плюс, Gemini заявлялась как первая модель, которая на нем превзошла уровень человеческих экспертов
Так вот, Gemini Ultra действительно лучше проходит MMLU с 32 chain-of-thought примерами – то есть, когда она генерит 32 варанта решения через chain-of-thought и выбирает лучший. Но на 5-shot промптинге выигрывает-то все равно GPT-4, когда такой сеттинг так-то сложнее 🤡 А в аппендиксе вообще сказано, что и по CoT@32 выигрывала тоже GPT-4, но вот с еще одним дополнительным косылем Gemini уехала вперед
Post #990
4.69K
я обучала одну модель Невероятно, но гугл не отложили релиз Gemini на следующий год* 🥳 https://blog.google/technology/ai/google-gemini-ai/ Обходит сейчас GPT-4 на всех бенчах, кроме HellaSwag Проскимила технический репорт, и увы про архитектуру не сказано почти ничего, кроме…



- ❤ 24