گوگل دیپمایند از مدل جدید «Gemini 2.5 Computer Use» رونمایی کرده که به هوش مصنوعی اجازه میده کارها رو درست مثل انسانها در محیطهای گرافیکی انجام بده، یعنی بتونه کلیک کنه، بنویسه و بین صفحات وب یا اپها جابهجا بشه. این مدل که بر پایهی تواناییهای دیداری و استدلالی Gemini 2.5 Pro ساخته شده، عملکرد خیلی بهتری نسبت به رقبا داره و با تأخیر کمتر اجرا میشه. توسعهدهندهها میتونن از طریق Gemini API در Google AI Studio یا Vertex AI بهش دسترسی پیدا کنن.
مدل جدید برای کنترل مرورگرها بهینه شده و در تستهای مختلف مثل Online-Mind2Web و WebVoyager نتایج خوبی گرفته. گوگل میگه این مدل میتونه فرمها رو پر کنه، فیلترها و منوها رو مدیریت کنه و حتی با فرم های لاگین کار کنه. همچنین ابزارهای ایمنی درون مدل تعبیه شدن تا جلوی اقدامهای پرخطر مثل دور زدن کپچا یا کنترل سیستمهای حساس گرفته بشه.
گوگل از این مدل در پروژههایی مثل تست خودکار رابطهای کاربری، Firebase Testing Agent و قابلیتهای عاملمحور «AI Mode» در جستوجو استفاده کرده. حالا هم نسخهی پیشنمایش عمومی در دسترسه و توسعهدهندهها میتونن از طریق محیط تست Browserbase یا مستندات رسمی گوگل، کار باهاش رو شروع کنن.
@aipulse24
Post #602
4.67K


- ❤ 17
- 👍 10