Кто занимается ИИ - очень рекомендую внимательно просмотреть свежий отчет Google DeepMind о текущем развитии Gemini. Это 150 страниц, включая иллюстрации и приложения, которые дают довольно подробную картину текущих раскладов и того, что можно вскоре ожидать.
Как и ChatGPT-4, Gemini, даже в рамках одной версии (1.5 Pro) постоянно обновляется - с февраля, т.е. за три месяца, по большинству измерений модель стала сильнее на 10-20%, а новая “легкая” модель 1.5 Flash справляется с большинством задач на уровне прошлогодней версии ChatGPT-4, используя при этом гораздо меньше ресурсов. Пока среди LMMs я безусловно отдаю предпочтение 1.5 Pro, которая к тому же по-прежнему доступна бесплатно и безлимитно на aistudio.google.com, и которая благодаря огромному контекстному окну позволяет напрямую решать множество задач и реализовывать сценарии взаимодействия там, где другие модели сразу упираются в лимиты.
Чтобы проиллюстрировать возможности, вот один из тестов, описанных в отчете (сс. 14-15): исследователи загружали аудиозапись, длительностью 107 часов (т.е. почти пять суток) - неразмеченную, с разными спикерами - и внутри этой записи в случайном месте вставляли несколько секунд с тестовой фразой. Потом они текстом просили модель найти ключевое слово в этой записи. Словом - классический тест “иголки в стоге сена”, но при этом мультимодальный (т.е. модель должна параллельно задействовать обработку и текста, и аудио содержания). 1.5. Pro дает правильный ответ в 100% случаев, 1.5. Flash - 98,7%.
С момента запуска тестового доступа к 1.5 Pro я использую Gemini практически ежедневно по несколько часов и всё ещё каждый раз испытываю ощущение чуда, от получаемых результатов и диапазона возможностей (4o тоже потрясающая штука, но это в другой раз).
Полный доклад доступен здесь https://storage.googleapis.com/deepmind-media/gemini/gemini_v1_5_report.pdf
Post #43
421