🤖 Gemini di deepmind: modello multimodale superiore raggiunge competenze umane
Il team di ricerca di Google DeepMind ha presentato una nuova famiglia di modelli multimodali chiamata Gemini, che dimostra notevoli competenze nella comprensione di immagini, audio, video e testo.
Questi modelli, basati su decodificatori Transformer, includono versioni Ultra, Pro e Nano, ciascuna progettata per affrontare specifiche limitazioni computazionali e requisiti applicativi. Gemini è in grado di integrare testo con input audio e visivi diversificati, gestendo la risoluzione variabile per la comprensione dei video e catturando dettagli trascurati in precedenza.
La valutazione su benchmark mostra che il modello Gemini Ultra supera le prestazioni umane in diversi casi. Il team enfatizza un approccio etico e responsabile nell'implementazione di tali modelli.
#AIInsights - by @UAITales
Post #3559
20.2K